FROM PREDICTOR TO ASSISTANT.
A PRE-TRAINED MODEL CONTINUES TEXT. FINE-TUNING AND HUMAN FEEDBACK SHIFT WHICH CONTINUATIONS IT PREFERS.

SAME KNOWLEDGE. NEW HABITS.
MOST KNOWLEDGE COMES FROM PRE-TRAINING. POST-TRAINING MAINLY RESHAPES BEHAVIOUR: WHICH REPLIES BECOME LIKELY.
- Policy (the model)
- Reference (SFT)
- Prompt, response
- Reward
- KL strength

Fine-tuning & RLHF
From Predictor to Assistant
PRE-TRAINING TEACHES A MODEL TO CONTINUE TEXT. FINE-TUNING ON WRITTEN EXAMPLES TEACHES IT TO ANSWER; A REWARD MODEL LEARNED FROM HUMAN COMPARISONS THEN STEERS IT TOWARD REPLIES PEOPLE PREFER, WHILE A KL PENALTY KEEPS IT CLOSE TO WHERE IT STARTED.
A thick pre-training slab (about 10 trillion tokens) carries the model's knowledge. Three thin layers sit on top — supervised fine-tuning (about ten thousand demonstrations), a reward model (about a hundred thousand comparisons) and RLHF (tens of thousands of prompts) — tied to the SFT layer by a KL leash, leading up to the assistant. Not to scale: the real cap is far thinner.
- SFT
- REWARD MODEL
- RL (PPO)
- DPO
- ALSO
- RLAIF: preference labels from an AI model
- Constitutional AI: feedback guided by written principles
- IN PRACTICE
- InstructGPT 1.3B was preferred over GPT-3 175B (2022).