MEASUREWHAT MODELSACTUALLY DO.
A BENCHMARK IS A HELD-OUT SET OF TEST CASES WITH A SCORING RULE. ITS SCORE ESTIMATES HOW A MODEL WILL DO ON INPUTS IT HAS NEVER SEEN.
ONE NUMBER IS NEVERTHE WHOLE STORY.

EVAL SCOPE
ONE SWEEP GRADES EVERY TEST CASE. EACH RING IS A BENCHMARK; EACH TICK IS ONE ITEM.
- MULTIPLE CHOICE
- 82 / 100
- CODE · PASS@1
- 0.52
- CODE · PASS@5
- 0.80
- RED-TEAM · SAFE
- 57 / 60
ILLUSTRATIVE RESULTS.
- PASS
- FAIL
- ATTACK GOT THROUGH
- JUST GRADED

Evaluation& Safety
Measuring What Models Do
A MODEL IS ONLY AS TRUSTWORTHY AS THE TESTS IT HAS PASSED. BENCHMARKS MEASURE SKILL, RED TEAMS HUNT FOR FAILURES, AND LAYERED SAFEGUARDS CATCH WHAT TRAINING MISSES. NO SINGLE LAYER IS PERFECT.
Four stacked safety layers, each a plate with a few holes. Of eight requests falling through them, seven are stopped by one layer or another; one passes through holes that happen to line up, is caught afterwards, and becomes new training data.
CATCH RATES ARE ILLUSTRATIVE.
SAFETY LAYERS
ONLY IF LAYERS FAIL INDEPENDENTLY.
- 01ALIGNMENT TRAININGc = 0.9
RLHF AND SIMILAR METHODS — PAGE 015
- 02SYSTEM PROMPTc = 0.8
RULES THE MODEL READS FIRST
- 03INPUT / OUTPUT CLASSIFIERSc = 0.9
SEPARATE MODELS SCREEN TRAFFIC
- 04MONITORING & REVIEWc = 0.7
WATCH REAL USE; RESPOND TO INCIDENTS
GOODHART'S LAW
WHEN A MEASURE BECOMES A TARGET, IT CEASES TO BE A GOOD MEASURE.