FROM TEXT TO TOKENS TO EMBEDDINGS.
A KEY-FRAME SEQUENCE SHOWING HOW A PROMPT BECOMES TOKENS AND THEN A DISTRIBUTED REPRESENTATION IN VECTOR SPACE.

TEXT BECOMES A SEQUENCE OF TOKEN VECTORS IN A HIGH-DIMENSIONAL SPACE.
MEANING EMERGES FROM GEOMETRY. SIMILAR TOKENS OCCUPY NEARBY REGIONS IN EMBEDDING SPACE.
01INPUT TEXT
A TYPED QUESTION AS A RAW STRING.
text = "What is artificial intelligence?"len(text) = 32 characters
02TOKENIZATION
- Whatisartificial
- intelligence?
THE TEXT BREAKS INTO DISCRETE TOKENS.
tokens = ["What", "is", "artificial", "intelligence", "?"]n_tokens = 5
03TOKEN IDS + TILES
- What3209
- is374
- artificial6273
- intelligence1936
- ?30
EACH TOKEN MAPS TO A VOCABULARY ID.
vocab_id = [3209, 374, 6273, 1936, 30]token_index = [0, 1, 2, 3, 4]
04LIFT TO EMBEDDING SPACE
TOKENS LIFT INTO D-DIMENSIONAL VECTORS.
05EMBEDDING SPACE (FINAL)
TOKENS OCCUPY A SEMANTIC SPACE WHERE SIMILAR MEANINGS CLUSTER.
(e.g. d = 768)
06SIMILARITY MATRIX
| What | is | artificial | intelligence | ? | |
|---|---|---|---|---|---|
| What | |||||
| is | |||||
| artificial | |||||
| intelligence | |||||
| ? |
SIMILAR TOKENS HAVE HIGHER COSINE SIMILARITY.

LATENTFrom Text to Tokens to Embeddings
A KEY-FRAME SEQUENCE SHOWING HOW A QUESTION IS TOKENIZED AND TRANSFORMED INTO A GEOMETRIC REPRESENTATION IN A HIGH-DIMENSIONAL SPACE.
TEXT
(sequence)
TOKENS
(discrete)
EMBEDDINGS
(vectors)
What is artificialintelligence?
- What
- is
- artificial
- intelligence
- ?
VOCABULARY
EMBEDDING
SIMILARITY
NEAREST NEIGHBORS
CLUSTERS (EXAMPLE)
- technology (e.g. AI, model)
- intelligence (e.g. mind, think)
- language (e.g. word, text)
- question (e.g. what, how)