ML System Design
90 problems
- Find the bottleneck executorMedium
- Format retrieved docs as contextEasy
- MockSearchEngine keyword retrievalEasy
- The RAG run: search → ground → answerMedium
- Aggregate trace eventsEasy
- Run totals from the traceEasy
- BM25 ScoringMedium
- Bradley-Terry Strength MLEHard
- Citation Attribution AssemblyMedium
- Clipped Inverse Propensity WeightingMedium
- Continuous Batching SchedulerHard
- Cross-Encoder Rerank Top-kEasy
- Edge models — magnitude pruningEasy
- Image preprocessing — scale and standardizeMedium
- RGB to grayscale (luminosity)Easy
- Edge models — measure sparsityEasy
- DDM Concept Drift DetectorMedium
- Elo Rating UpdateEasy
- Expected Reciprocal Rank (ERR)Medium
- Exponential Backoff + JitterEasy
- Faithfulness / Groundedness ScoreMedium
- Feature Hashing (Hashing Trick)Medium
- Gradient checkpointing forwardEasy
- Group / Time-Series CV SplitEasy
- Hard Negative Mining for RetrieverMedium
- HNSW Greedy Graph SearchHard
- Post-Training int8 QuantizationMedium
- Team-Draft Interleaving (Online Ranking Eval)Medium
- IVF (Inverted File) SearchMedium
- Jensen-Shannon Divergence (Drift)Medium
- Kendall's TauMedium
- Knowledge-Distillation LossMedium
- Kolmogorov-Smirnov StatisticMedium
- KV-Cache Eviction (Sliding Window)Medium
- Label-Noise Detection (Confident Learning)Hard
- LambdaMART Lambda GradientsHard
- ListNet Listwise Ranking LossMedium
- Little's LawEasy
- Magnitude PruningEasy
- Mann-Whitney U TestMedium
- Sentence Embedding (Masked Mean-Pool)Easy
- Matryoshka Embedding TruncationMedium
- Mean Average Precision (MAP)Medium
- Mean reciprocal rank (MRR)Easy
- MinHash for Near-Duplicate DetectionMedium
- MIPS -> L2 ReductionMedium
- Maximal Marginal Relevance (MMR)Medium
- Multi-Query Fan-Out + DedupEasy
- Multi-Task Score FusionMedium
- Multi-Tool Router (by Embedding)Medium
- Mutual informationMedium
- Negative Sampling (Implicit Feedback)Medium
- Out-of-Fold Target EncodingMedium
- Paged-Attention KV Block AllocationMedium
- Pairwise cosine-similarity matrixEasy
- Pairwise Ranking Loss (BPR / RankNet)Medium
- Parent-Document RetrievalMedium
- Permutation Feature ImportanceMedium
- PII Detection & RedactionMedium
- Point-in-Time Feature JoinMedium
- Population Stability Index (PSI)Medium
- Precision@k and NDCG@kMedium
- Prefix-Cache Hit AccountingEasy
- Product Quantization (PQ) Encode + ADCHard
- Random-Hyperplane LSH (Cosine)Medium
- Recall@k (Retrieval)Easy
- Reciprocal Rank Fusion (RRF)Medium
- Recursive Chunking with OverlapMedium
- Refusal / Confidence GateEasy
- Reservoir samplingMedium
- Run-Level Cost / Budget CeilingMedium
- Sample Ratio Mismatch (SRM) CheckMedium
- In-Batch Sampled Softmax + logQ CorrectionHard
- Semaphore-Bounded Concurrent TasksMedium
- Prepare RNN data — scale, window, reshapeMedium
- Sequence padding & maskingEasy
- Shadow / Canary Rollback DecisionMedium
- Sliding-Window Counter (Streaming Feature)Medium
- Smoothed Target (Mean) EncodingMedium
- Sorted polynomial featuresMedium
- Spearman Rank CorrelationEasy
- Streaming SSE Delta AssemblerEasy
- Stop-Sequence Detection (Streaming)Easy
- Task-DAG Parallel SchedulerHard
- Temporal Train/Val SplitEasy
- TF-IDFMedium
- Token-Bucket Rate LimiterEasy
- Trace Aggregation SummaryEasy
- Two-Tower Top-k RetrievalEasy
- WordPiece Tokenization (Greedy Longest-Match)Medium