NLP
30 problems
- Teacher forcing — next-token targetsMedium
- Map a model to its transformer familyEasy
- Pretraining objective per familyEasy
- Bag-of-words encodingEasy
- BERTScore (Greedy Token-Cosine F1)Medium
- BLEU score (unigram)Medium
- BM25 ScoringMedium
- BPE: apply mergesMedium
- Train BPE merges from a corpusHard
- Byte-level UTF-8 tokenizerMedium
- The autoregressive generation loopMedium
- How big is the nucleus?Easy
- Levenshtein Edit DistanceEasy
- Longest Common SubsequenceMedium
- Sentence Embedding (Masked Mean-Pool)Easy
- METEOR scoreMedium
- Perplexity from log-probsEasy
- PII Detection & RedactionMedium
- Planner Output ParserEasy
- Pointwise mutual information (PMI)Medium
- QA Token F1 / Exact MatchMedium
- Recursive Chunking with OverlapMedium
- ROUGE-1 scoreEasy
- Build a vocabularyEasy
- Encode a sentence (with UNK)Easy
- One-hot encode a token sequenceEasy
- Sequence padding & maskingEasy
- TF-IDFMedium
- Unigram probability from a corpusEasy
- WordPiece Tokenization (Greedy Longest-Match)Medium