WHAT THE MODEL CAN REMEMBER.
A MODEL KEEPS NO NOTES BETWEEN WORDS. ALL IT HAS IS THE TEXT IN FRONT OF IT — THE CONTEXT WINDOW — AND THAT WINDOW HAS A FIXED SIZE.

LOOK BACK, NEVER AHEAD.
EACH NEW TOKEN ATTENDS TO EVERY EARLIER TOKEN IN THE WINDOW. THEIR KEYS AND VALUES WAIT IN A CACHE, SO NOTHING IS COMPUTED TWICE.
WINDOW SHOWN: 12 TOKENS REAL MODELS: 8K – 1M+ TOKENS

ContextWindow &KV Cache
What the Model Can Remember
THE CONTEXT WINDOW IS THE MODEL'S ONLY WORKING MEMORY. EACH NEW TOKEN LOOKS BACK OVER IT, AND THE PAST KEYS AND VALUES ARE CACHED — SO A LONGER CONTEXT MEANS MORE MEMORY AND SLOWER STEPS.
KV CACHE SIZE
- KEYS + VALUES
- LAYERS
- KV HEADS
- DIMS PER HEAD
- TOKENS IN CONTEXT
- BYTES (FP16)