HOW AI WORKS - FRAME BOOK
VOL. 01·SEP 2026

WHAT THE MODEL CAN REMEMBER.

A MODEL KEEPS NO NOTES BETWEEN WORDS. ALL IT HAS IS THE TEXT IN FRONT OF IT — THE CONTEXT WINDOW — AND THAT WINDOW HAS A FIXED SIZE.

LOOK BACK, NEVER AHEAD.

EACH NEW TOKEN ATTENDS TO EVERY EARLIER TOKEN IN THE WINDOW. THEIR KEYS AND VALUES WAIT IN A CACHE, SO NOTHING IS COMPUTED TWICE.

WINDOW SHOWN: 12 TOKENS REAL MODELS: 8K – 1M+ TOKENS

01CONTEXT WINDOW

nin+nout≤Nmax⁡n_{\text{in}} + n_{\text{out}} \le N_{\max}

Everything must fit. The oldest falls out.

02CAUSAL MASK

A=softmax ⁣(QK⊤dk+M)A = \mathrm{softmax}\!\left(\dfrac{QK^{\top}}{\sqrt{d_k}} + M\right)
Mij=−∞ if j>iM_{ij} = -\infty \ \text{if}\ j > i

Each token sees only the past.

03KV CACHE

n(n+1)2⏟no cache  vs  n⏟cache\underbrace{\tfrac{n(n+1)}{2}}_{\text{no cache}} \;\text{vs}\; \underbrace{n}_{\text{cache}}

Keep past keys and values. Reuse them.

04CACHE MEMORY

KV=2⋅L⋅hkv⋅dhead⋅n⋅b\text{KV} = 2 \cdot L \cdot h_{kv} \cdot d_{\text{head}} \cdot n \cdot b
L=32, dhead=128, b=2L{=}32,\ d_{\text{head}}{=}128,\ b{=}2

Memory grows with every token.

05PREFILL · DECODE

prefill∝n2decode∝n per token\text{prefill} \propto n^{2} \qquad \text{decode} \propto n \text{ per token}

Prompt in parallel. Answer one token at a time.

ContextWindow &KV Cache

What the Model Can Remember

THE CONTEXT WINDOW IS THE MODEL'S ONLY WORKING MEMORY. EACH NEW TOKEN LOOKS BACK OVER IT, AND THE PAST KEYS AND VALUES ARE CACHED — SO A LONGER CONTEXT MEANS MORE MEMORY AND SLOWER STEPS.

KV CACHE SIZE

KV=2 L hkv dhead n b\text{KV} = 2\,L\,h_{kv}\,d_{\text{head}}\,n\,b
  • 22KEYS + VALUES
  • L=32L = 32LAYERS
  • hkv=32h_{kv} = 32KV HEADS
  • dhead=128d_{\text{head}} = 128DIMS PER HEAD
  • nnTOKENS IN CONTEXT
  • b=2b = 2BYTES (FP16)
  • =0.5 MiB×n= 0.5\ \text{MiB} \times n
  • n=32,768  ⇒  16 GiBn = 32{,}768 \;\Rightarrow\; 16\ \text{GiB}
  • hkv=8 (GQA)  ⇒  4 GiBh_{kv} = 8\ (\text{GQA}) \;\Rightarrow\; 4\ \text{GiB}