Top Interview Questions
The 100 most interview-relevant ML problems — attention, backprop, optimizers, metrics & more — hand-picked from the catalog and ranked.
100 problems · ranked by interview relevance.
Sign in to track your progress0%
Solve a problem (pass its tests) and it's checked off here automatically — your progress is saved, so it stays checked when you come back.
- Platt ScalingMedium
- BatchNorm forward (train + eval modes)Medium
- Scaled dot-product self-attentionMedium
- Adam optimiser stepMedium
- Cross-Attention (Encoder-Decoder)Medium
- Softmax from scratchEasy
- Basic autograd operationsMedium
- Dense block with 2D convolutionsMedium
- FlashAttention tiled forwardHard
- Softmax (multinomial) regressionMedium
- Conv2D forward (padding + stride)Medium
- Dropout layer (forward & backward)Medium
- Rotary Position Embedding (RoPE)Hard
- Conv2D backward (dx, dW)Hard
- Elastic-Net regression (gradient descent)Medium
- Logistic regression — gradient descentMedium
- Conv2D forward (naive, stride 1, no pad)Medium
- Transformer block forward (pre-LN, residual)Hard
- AdamW step (decoupled weight decay)Medium
- Multi-Head Attention (full layer)Medium
- Linear regression — gradient descentEasy
- Scaled dot-product attentionMedium
- Multi-head split + combineMedium
- Adamax optimizerMedium
- SGD step (in place)Easy
- Nesterov accelerated gradientMedium
- Binary classification with logistic regressionEasy
- LayerNorm forwardEasy
- Linear backward (chain rule)Medium
- Linear regression — normal equationMedium
- Lion optimizer stepMedium
- Log-softmaxEasy
- SGD with momentum (one step)Easy
- Matmul backwardMedium
- Softmax backwardMedium
- QA Token F1 / Exact MatchMedium
- Singular Value Decomposition (2x2)Hard
- IoU of bounding boxesEasy
- Group / Time-Series CV SplitEasy
- K-means: one iterationMedium
- Clipped Inverse Propensity WeightingMedium
- Sigmoid forward + backwardEasy
- Principal Component Analysis (PCA)Medium
- GELU backward (tanh approximation)Medium
- Jaccard similarityEasy
- Pairwise cosine-similarity matrixEasy
- VAE ELBO lossMedium
- Cross-entropy gradientMedium
- k-NN classification (majority vote)Easy
- Temporal Train/Val SplitEasy
- Weighted cross-entropyEasy
- MSE loss + backwardEasy
- Euclidean distance matrixEasy
- Label-smoothed cross-entropyMedium
- Multi-class cross-entropy lossEasy
- ReLU forward + backwardEasy
- He weight initializationEasy
- KL divergence (discrete)Easy
- Leaky ReLU activationEasy
- GELU forward (tanh approximation)Easy
- Bernoulli Naive Bayes classifierMedium
- Decision tree learning (ID3)Hard
- WordPiece Tokenization (Greedy Longest-Match)Medium
- Grouped-query attentionMedium
- Best Gini-based split (decision tree)Medium
- KV cache for autoregressive inferenceMedium
- Sequence padding & maskingEasy
- F1 score (binary classification)Easy
- Precision@k and NDCG@kMedium
- Group normalizationMedium
- BERTScore (Greedy Token-Cosine F1)Medium
- Confusion matrixEasy
- Mean reciprocal rank (MRR)Easy
- Divide dataset by feature thresholdEasy
- ROC-AUC from scratchMedium
- Adadelta optimizerMedium
- Clip gradients by global L2 normEasy
- Diffusion forward processMedium
- Precision metricEasy
- RMSprop optimizerEasy
- Shannon entropyEasy
- Accuracy scoreEasy
- Train BPE merges from a corpusHard
- Beam search decodingMedium
- BPE: apply mergesMedium
- TF-IDFMedium
- Sorted polynomial featuresMedium
- Greedy decoding loopEasy
- Huber & Hinge lossesEasy
- Contrastive lossMedium
- Warmup + cosine decay LR scheduleEasy
- Focal loss (multiclass)Medium
- Triplet lossMedium
- Dice lossEasy
- Paged-Attention KV Block AllocationMedium
- CLIP InfoNCE LossMedium
- Top-p (nucleus) samplingMedium
- Top-k samplingEasy
- Gradient Boosting: One Round (Stump)Medium
- DBSCAN clusteringMedium