IMAGES BECOME TOKENS.
A VISION TRANSFORMER CUTS A PICTURE INTO SQUARE PATCHES AND READS THEM IN ORDER, LIKE WORDS IN A SENTENCE.

SAME ATTENTION. NEW KIND OF TOKEN.
EACH 16 × 16 PATCH IS FLATTENED, PROJECTED, GIVEN A POSITION, THEN READ EXACTLY LIKE TEXT.
VIT-BASE/16
image = 224 × 224 × 3 patch = 16 × 16 tokens = 196 + [CLS] d_model = 768 layers = 12

VisionTransformers
Images as Tokens
A VISION TRANSFORMER TURNS PIXELS INTO THE SAME KIND OF TOKENS A LANGUAGE MODEL READS. TRAINED ON IMAGES WITH CAPTIONS, PICTURES AND WORDS MEET IN ONE SHARED SPACE.
IMAGE ENCODER TEXT ENCODER "a wire sphere""a five-point star""a sine wave""a lattice"SHARED EMBEDDING SPACEPULL MATCHING PAIRS TOGETHER. PUSH THE REST APART.
- TWO ENCODERS
- SIMILARITY
- CONTRASTIVE MATCHING
- LOSS (IMAGE → TEXT)
- + THE SAME FOR TEXT → IMAGE