Machine Learning Basics: Supervised vs Unsupervised
Supervised Learning (labeled data)
Regression: predict a number
Linear regression, e.g. house prices
Classification: predict a category
Logistic regression, decision trees, random forests
Requires labeled training examples
Unsupervised Learning (no labels)
Clustering: k-means, DBSCAN
Dimensionality reduction: PCA
Finds hidden structure in raw data
Training Essentials
Split data: train / validation / test
Overfitting: memorizes training data, fails on new data
Underfitting: model too simple for the pattern
Cross-validation gives honest estimates
Evaluation Metrics
Accuracy misleads on imbalanced classes
Precision vs recall: a real trade-off
RMSE is the classic regression error measure
Classic Starter Datasets
Titanic: binary classification
Iris: multi-class classification
Boston-style housing data: regression
作者