Glossário
Diffusion model
Uma classe de modelos generativos de IA que aprendem a reverter um processo de adição de ruído — partindo de ruído puro e removendo o ruído progressivamente até chegar a uma imagem ou vídeo que corresponda ao prompt.
Em detalhe
O que significa na prática
Os modelos de difusão são a arquitetura dominante para geração de imagens por IA em 2026. Modelos como Stable Diffusion (SDXL), FLUX e Nano Banana 2 são todos baseados em difusão. Modelos de vídeo como Sora 2 e Kling estendem a ideia da difusão ao espaço-tempo — removendo o ruído de um volume de ruído para produzir uma sequência coerente de quadros.
A principal vantagem dos modelos de difusão sobre as arquiteturas anteriores (GANs, VAEs) é a qualidade das amostras e a fidelidade ao prompt. O trade-off é a velocidade de geração: cada resultado exige várias iterações de remoção de ruído, em vez de uma única passagem direta. É por isso que as gerações baseadas em difusão custam o que custam.
Relacionado
Inference steps
O número de passagens iterativas de refinamento que o modelo realiza para produzir um resultado. Mais passos geralmente significam qualidade maior, com retornos decrescentes acima de um limite específico de cada modelo.
CFG scale
Um parâmetro que controla o quão fielmente o modelo segue o prompt de texto. CFG mais alto = interpretação mais literal; CFG mais baixo = mais liberdade criativa. Faixa típica de 4 a 12.
Text-to-image
Um modo de geração em que a entrada é texto (o prompt) e a saída é uma imagem. O modo de geração de imagens por IA mais comum.