HOW AI WORKS - FRAME BOOK
VOL. 01·SEP 2026

MEASUREWHAT MODELSACTUALLY DO.

A BENCHMARK IS A HELD-OUT SET OF TEST CASES WITH A SCORING RULE. ITS SCORE ESTIMATES HOW A MODEL WILL DO ON INPUTS IT HAS NEVER SEEN.

ONE NUMBER IS NEVERTHE WHOLE STORY.

MULTIPLE CHOICE
82 / 100
CODE
52% · 80%
RED-TEAM
57 / 60
MODEL

EVAL SCOPE

ONE SWEEP GRADES EVERY TEST CASE. EACH RING IS A BENCHMARK; EACH TICK IS ONE ITEM.

accuracy=1N∑i=1N1[y^i=yi]\text{accuracy} = \dfrac{1}{N} \sum_{i=1}^{N} \mathbf{1}\left[\hat{y}_i = y_i\right]
MULTIPLE CHOICE
82 / 100
CODE · PASS@1
0.52
CODE · PASS@5
0.80
RED-TEAM · SAFE
57 / 60

ILLUSTRATIVE RESULTS.

  • PASS
  • FAIL
  • ATTACK GOT THROUGH
  • JUST GRADED

01HELD-OUT SPLIT

Dtrain∩Dtest=∅\mathcal{D}_{\text{train}} \cap \mathcal{D}_{\text{test}} = \varnothing

SCORE ON DATA THE MODEL NEVER SAW.

TEST SCORE 20 / 24 = 83%

TRAIN
TEST

02MULTIPLE CHOICE

acc=# correctNchance=14\text{acc} = \dfrac{\#\,\text{correct}}{N} \qquad \text{chance} = \dfrac{1}{4}

PICK A LETTER; COMPARE WITH THE KEY.

4 OPTIONS, SO GUESSING SCORES 25%.

03PASS@k

pass@k=1−(n−ck)(nk)\text{pass@}k = 1 - \dfrac{\binom{n-c}{k}}{\binom{n}{k}}

SAMPLE k TIMES; ANY PASS COUNTS.

AVERAGED OVER ALL PROBLEMS.

04CONTAMINATION

Dtest∩Dtrain≠∅  ⇒  inflated score\mathcal{D}_{\text{test}} \cap \mathcal{D}_{\text{train}} \neq \varnothing \;\Rightarrow\; \text{inflated score}

LEAKED TEST ITEMS INFLATE THE SCORE.

CHECK OVERLAP; KEEP TEST SETS PRIVATE.

TRAINING DATA
TEST SET
ALL 79%
CLEAN 72%

05JUDGES

P(A≻B)=11+10(RB−RA)/400P(A \succ B) = \dfrac{1}{1 + 10^{(R_B - R_A)/400}}

COMPARE TWO ANSWERS; COUNT THE WINS.

A WINS 5 / 8 ≈\approx +89 ELO. JUDGES HAVE BIASES.

06RED-TEAMING

ASR=# successful attacks# attempts\text{ASR} = \dfrac{\#\,\text{successful attacks}}{\#\,\text{attempts}}

ATTACK ON PURPOSE TO FIND FAILURES.

ASR = 1 / 12 ≈\approx 8%

FAILURE FOUND

07EVAL LOOP

Dtrain←Dtrain∪Dfail\mathcal{D}_{\text{train}} \leftarrow \mathcal{D}_{\text{train}} \cup \mathcal{D}_{\text{fail}}

FAILURES BECOME DATA; THEN TEST AGAIN.

NEVER TRAIN ON THE HELD-OUT SET.

TRAIN
EVALUATE
RED-TEAM
DEPLOY +MONITOR
COLLECT FAILURES
HELD-OUTTEST SET

Evaluation& Safety

Measuring What Models Do

A MODEL IS ONLY AS TRUSTWORTHY AS THE TESTS IT HAS PASSED. BENCHMARKS MEASURE SKILL, RED TEAMS HUNT FOR FAILURES, AND LAYERED SAFEGUARDS CATCH WHAT TRAINING MISSES. NO SINGLE LAYER IS PERFECT.

FAILURE →\rightarrow NEW TRAINING DATA

Four stacked safety layers, each a plate with a few holes. Of eight requests falling through them, seven are stopped by one layer or another; one passes through holes that happen to line up, is caught afterwards, and becomes new training data.

CATCH RATES ARE ILLUSTRATIVE.

SAFETY LAYERS

P(miss all)=∏ℓ=14(1−cℓ)P(\text{miss all}) = \prod_{\ell=1}^{4} (1 - c_\ell)
=0.1⋅0.2⋅0.1⋅0.3=0.0006= 0.1 \cdot 0.2 \cdot 0.1 \cdot 0.3 = 0.0006

ONLY IF LAYERS FAIL INDEPENDENTLY.

  1. 01ALIGNMENT TRAININGc = 0.9

    RLHF AND SIMILAR METHODS — PAGE 015

  2. 02SYSTEM PROMPTc = 0.8

    RULES THE MODEL READS FIRST

  3. 03INPUT / OUTPUT CLASSIFIERSc = 0.9

    SEPARATE MODELS SCREEN TRAFFIC

  4. 04MONITORING & REVIEWc = 0.7

    WATCH REAL USE; RESPOND TO INCIDENTS

GOODHART'S LAW

WHEN A MEASURE BECOMES A TARGET, IT CEASES TO BE A GOOD MEASURE.