LEARNING FROM THE NEXT TOKEN.
A MODEL READS TEXT LEFT TO RIGHT AND GUESSES EACH NEXT TOKEN. NO HUMAN LABELS: THE TEXT ITSELF IS THE ANSWER KEY.
SURPRISE
EACH GUESS IS SCORED BY HOW SURPRISED THE MODEL IS BY THE TRUE NEXT TOKEN.
- Context so far
- True next token
- Model probability
- Surprise (loss)
- Mean surprise

Pre-training
Learning from Next-Token Prediction
A LANGUAGE MODEL LEARNS BY READING. AT EVERY POSITION IN TRILLIONS OF TOKENS IT GUESSES THE NEXT ONE, SCORES ITS SURPRISE, AND NUDGES ITS PARAMETERS TO BE LESS SURPRISED NEXT TIME.
CORPUSraw textTOKENSBATCHMODEL
- OBJECTIVE
- SURPRISE
- p = 0.40 0.92
- p = 0.02 3.91
- PERPLEXITY
- like choosing among ~5 tokens
- BEFORE TRAINING
- uniform guess over the vocabulary
- SCALE (EXAMPLES)
- GPT-3 · 300B tokens · 2020
- Llama 3 · 15T tokens · 2024