Models de difusió explicats: les matemàtiques darrere de Stable Diffusion
La idea central
Els models de difusió formen part de la família dels models generatius amb variables latents. La seva idea és elegant: en lloc d’aprendre a generar dades directament, aprenen a eliminar-ne el soroll.
Durant l’entrenament, les mostres de dades es corrompen afegint soroll gaussià progressivament al llarg de passos fins que les dades són pràcticament indistingibles de soroll pur. El model aprèn després a invertir aquest procés, predient i eliminant el soroll pas a pas.
El procés directe
Donada una mostra neta , el procés directe defineix una cadena de Markov que afegeix soroll gradualment:
on és un calendari de soroll fix. Una propietat útil és que podem mostrejar directament a partir de en forma tancada. Definim i :
O, de manera equivalent, amb el truc de reparametrització:
Quan , i .
El procés invers
El procés invers aprèn a eliminar el soroll pas a pas:
La xarxa s’entrena per predir el soroll que s’havia afegit. La funció objectiu d’entrenament se simplifica a:
Això és simplement un problema de regressió de denoising: predir el soroll i minimitzar l’MSE.
L’arquitectura de xarxa: U-Net
La xarxa de denoising és una U-Net, una arquitectura encoder-decoder amb skip connections entre mapes de característiques corresponents de l’encoder i el decoder.
Input x_t + timestep embedding
↓
[Conv] → [ResBlock] → [Attention] → [Downsample]
↓ ↓
[Conv] → [ResBlock] → [Attention] → [Downsample]
↓
Middle Block (ResBlock + Attention)
↓
[Upsample] → [ResBlock] → [Attention]
↓
[Upsample] → [ResBlock] → [Attention]
↓
Output (predicted noise ε)
El timestep es codifica com un embedding sinusoidal, similar a les codificacions posicionals dels Transformers, i s’injecta a cada ResBlock mitjançant condicionament FiLM.
Calendaris de soroll
El calendari controla amb quina rapidesa s’acumula el soroll. Algunes opcions habituals són:
- Lineal (DDPM): creix linealment de fins a
- Cosinus (DDPM millorat): — evita afegir massa soroll als primers passos
- Flow matching (utilitzat a Stable Diffusion 3 i Flux): trajectòries rectes a través de l’espai dades-soroll per accelerar el mostreig
DDIM: mostreig més ràpid
El DDPM estàndard necessita passos de denoising per generar una sola imatge. DDIM (Denoising Diffusion Implicit Models) reformula el procés invers com una cadena no markoviana, cosa que permet generar en 20–50 passos amb una qualitat comparable.
El pas d’actualització DDIM és:
Models de difusió latent
Stable Diffusion treballa en espai latent, no en espai de píxels. Primer, un autoencoder variacional (VAE) comprimeix la imatge:
El procés de difusió s’executa sobre el latent , habitualment de per a una imatge de . Això redueix el cost computacional aproximadament 48× respecte de la difusió en espai de píxels.
Classifier-Free Guidance
Per guiar la generació cap a un prompt de text , classifier-free guidance interpola entre prediccions condicionals i incondicionals:
L’escala de guidance controla el compromís entre qualitat de la mostra (valors més alts de ) i diversitat (valors més baixos). Valors típics són 7–15.
Idees clau
- Els models de difusió formulen la generació com un procés iteratiu de denoising amb una funció objectiu de regressió simple
- El procés directe defineix analíticament a partir de en un sol pas, cosa que fa eficient l’entrenament
- DDIM redueix els passos d’inferència de 1000 a aproximadament 20–50 sense reentrenar
- La difusió latent de Stable Diffusion trasllada el procés a un espai latent comprimit d’un VAE per fer viable la generació d’alta resolució
- Classifier-free guidance és el principal control sobre la fidelitat de la sortida i l’adhesió al prompt