HOW AI WORKS - FRAME BOOK
VOL. 01·SEP 2026

TRAINING AS OPTIMIZATION.

GRADIENT DESCENT ITERATIVELY UPDATES PARAMETERS TO MINIMIZE A LOSS FUNCTION.

L(θ)L(\theta)θ1\theta_1θ2\theta_2

OBJECTIVE

FIND PARAMETERS θ\theta THAT MINIMIZE A LOSS FUNCTION L(θ).L(\theta).

θt+1=θt−η∇L(θt)\theta_{t+1} = \theta_t - \eta \nabla L(\theta_t)
θ\theta
Parameters
L(θ)L(\theta)
Loss function
∇L(θ)\nabla L(\theta)
Gradient (slope)
η\eta
Learning rate
tt
Iteration step

01INITIALIZATION

L(θ0)=2.49L(\theta_0) = 2.49

Start from an initial parameter position.

02GRADIENT

∇L(θ0)=[1.2, −0.8]\nabla L(\theta_0) = [1.2,\ -0.8]

Compute the gradient at the current position.

03PARAMETER UPDATE

θt+1=θt−η∇L(θt)\theta_{t+1} = \theta_t - \eta \nabla L(\theta_t)

Move a small step in the negative gradient direction.

04ITERATION

Repeat the update to gradually descend the loss surface.

05CONVERGENCE

L(θ∗)=0.03L(\theta^*) = 0.03

Converge to a (local) minimum where ∇L(θ∗)≈0.\nabla L(\theta^*) \approx 0.

Training as Optimization

Gradient Descent in Parameter Space

TRAINING A MODEL CAN BE SEEN AS AN OPTIMIZATION PROBLEM. GRADIENT DESCENT ITERATIVELY UPDATES PARAMETERS TO MINIMIZE A LOSS FUNCTION, FOLLOWING THE LOCAL SLOPE OF THE LOSS LANDSCAPE.

LOSS OVER TIME

10110^{1}10010^{0}10−110^{-1}10−210^{-2}020406080100Iteration (tt)L(θ)L(\theta)

LEARNING RATE

θt+1=θt−η∇L(θt)\theta_{t+1} = \theta_t - \eta \nabla L(\theta_t)
  • η\eta too largemay overshoot
  • η\eta too smallslow convergence
  • η\eta well chosenstable and efficient

LOSS LANDSCAPE (CONTOURS)

Contours show levels of equal loss. Gradient descent moves orthogonally to the contours toward lower values.