WHAT LIVESINSIDE THELATENT SPACE?
A MODEL'S HIDDEN STATE IS A DENSE LIST OF NUMBERS. INTERPRETABILITY TRIES TO SPLIT IT INTO FEATURES: DIRECTIONS THAT TRACK CONCEPTS WE CAN NAME.
ACTIVE RESEARCH.READ CLAIMS AS PROVISIONAL.

64 OF 16,384 FEATURES SHOWN
FEATURE PRISM
A SPARSE AUTOENCODER UNFOLDS ONE DENSE ACTIVATION INTO MANY FEATURES. ONLY A FEW LIGHT UP FOR ANY TOKEN.
d = 768m = 16,384active 30 per token
TOKENGateBridgeTheGolden
- #1207
- golden gate bridge
- 0.93
- #3308
- san francisco
- 0.71
- #6015
- landmarks
- 0.54
- #1207
- golden gate bridge
- 0.97
- #4480
- bridges
- 0.82
- #6015
- landmarks
- 0.60
- #0412
- start of sentence
- 0.84
- #0937
- articles (the, a)
- 0.77
- #2291
- english text
- 0.62
- #5530
- gold / golden
- 0.88
- #7702
- capitalized word
- 0.66
- #2291
- english text
- 0.58

Interpretability
Features in Latent Space
INTERPRETABILITY ASKS WHAT A TRAINED MODEL REPRESENTS AND HOW IT USES IT. NEURONS MIX MANY CONCEPTS, SO RESEARCHERS LEARN SPARSE DICTIONARIES THAT SPLIT ACTIVATIONS INTO FEATURES THEY CAN NAME, TEST AND STEER.
LATENT SPACE
- ACTIVATION (RESIDUAL STREAM)
- FEATURE DIRECTION
- SPARSE CODE
- SPARSITY
- STEERING
CAVEATS
- LABELS ARE HUMAN INTERPRETATIONS.
- DICTIONARIES MISS PART OF THE SIGNAL.
- DECODABLE IS NOT THE SAME AS USED.