LOSS FALLS ON A STRAIGHT LINE.
ON LOG–LOG AXES, LOSS DROPS AS A POWER LAW OF MODEL SIZE, DATA, AND COMPUTE: SMOOTH ENOUGH THAT SMALL RUNS PREDICT BIG ONES.
COMPUTE-OPTIMAL FRONTIER
EACH THIN CURVE IS ONE MODEL SIZE, TRAINED ON MORE AND MORE TOKENS. THE LOWEST LOSS FOR EACH BUDGET TRACES THE STRAIGHT CYAN LINE.
- Parameters
- Training tokens
- Compute (FLOPs)
- Test loss
- Irreducible loss

ScalingLaws
More Data, More Compute, Lower Loss
LOSS FALLS SMOOTHLY AND PREDICTABLY AS MODELS, DATA, AND COMPUTE GROW. FOR A FIXED BUDGET, THE BEST RESULT BALANCES MODEL SIZE AGAINST TRAINING TOKENS: ROUGHLY 20 TOKENS PER PARAMETER.
LOSS OVER THE N–D PLANETOKENS PARAMS 20 : 1C = constCHINCHILLAGOPHER
- LOSS MODEL
- COMPUTE
- FLOPs 6 × parameters × tokens
- COMPUTE-OPTIMAL
- RULE OF THUMB
- EXAMPLES
- Chinchilla · 70B · 1.4T · 20:1
- Gopher · 280B · 0.3T · ~1:1
- GPT-3 · 175B · 0.3T · ~2:1
- IN PRACTICE
- Small models are often trained far past 20:1: they are cheaper to run.