5 questions across Easy, Medium, and Hard levels
Supervised learning uses labeled training data (input-output pairs) to learn a mapping function. Examples: regression, classification. Unsupervised learning finds patterns in unlabeled data without predefined outputs. Examples: clustering (K-means), dimensionality reduction (PCA), anomaly detection. Semi-supervised uses a mix of labeled and unlabeled data.
Overfitting occurs when a model learns training data too well, including noise, and performs poorly on new data. Prevention techniques: 1) Cross-validation (k-fold), 2) Regularization (L1/Lasso, L2/Ridge), 3) Dropout (neural networks), 4) More training data, 5) Feature selection/reduction, 6) Simpler model (reduce complexity), 7) Early stopping. Detect by: training accuracy >> validation accuracy.
Bias: error from wrong assumptions (underfitting - model too simple). Variance: error from sensitivity to fluctuations in training data (overfitting - model too complex). Total Error = BiasΒ² + Variance + Irreducible Error. High bias β add features, increase model complexity. High variance β add data, regularization, reduce complexity. The goal is to find the sweet spot minimizing total error.
Approaches: 1) Delete rows with missing values (if few, random). 2) Imputation: mean/median/mode for numerical data. 3) Forward/backward fill for time series. 4) KNN imputation (similar records). 5) Multiple imputation (sophisticated). 6) Create a "missing" indicator variable. 7) Use algorithms that handle missing values (XGBoost, LightGBM). Choice depends on: amount missing, pattern (MCAR/MAR/MNAR), and downstream model.
Gradient Boosting builds an ensemble of weak learners (usually decision trees) sequentially, where each tree corrects the errors of the previous ones. Algorithm: 1) Start with a simple prediction (mean). 2) Calculate residuals (actual - predicted). 3) Fit a tree to residuals. 4) Add tree Γ learning rate to predictions. 5) Repeat for N trees. XGBoost and LightGBM are optimized implementations. Key hyperparameters: n_estimators, learning_rate, max_depth, subsample.