WORDS STEER THE NOISE.
TEXT-TO-IMAGE MODELS START FROM NOISE, AS IN 009. EVERY STEP OF DENOISING LOOKS BACK AT THE PROMPT.

PROMPT IN. PICTURE OUT.
EACH REGION OF THE LATENT ASKS WHICH WORDS MATTER, THROUGH CROSS-ATTENTION.
STABLE DIFFUSION 1.X
prompt = 77 tokens
latent = 64 × 64 × 4
image = 512 × 512 × 3
steps = 20–50
w = 7.5

Text-to-Image
Guiding Diffusion with Words
A TEXT ENCODER TURNS THE PROMPT INTO VECTORS. A DENOISER CLEANS A SMALL LATENT STEP BY STEP, READING THOSE VECTORS EVERY TIME, AND A DECODER PAINTS THE PIXELS.
NOISELATENTIMAGEPROMPT
- TEXT ENCODER
- CLIP, AS IN 019
- LATENT (VAE)
- TRAINING
- PROMPT DROPPED ~10% OF THE TIME
- GUIDANCE
- TYPICAL w = 7.5
- SAMPLING
- = PURE NOISE · 20–50 STEPS