Glossário
Diffusion model
Uma classe de modelos generativos de IA que aprendem a inverter um processo de adição de ruído — partindo de ruído puro e removendo-o progressivamente até obter uma imagem ou vídeo que corresponda ao prompt.
Em detalhe
O que significa na prática
Os modelos de difusão são a arquitetura dominante para a geração de imagem por IA em 2026. Modelos como o Stable Diffusion (SDXL), o FLUX e o Nano Banana 2 são todos baseados em difusão. Modelos de vídeo como o Sora 2 e o Kling estendem a ideia de difusão ao espaço-tempo — removendo o ruído de um volume de ruído para produzir uma sequência coerente de fotogramas.
A principal vantagem dos modelos de difusão sobre arquiteturas anteriores (GANs, VAEs) é a qualidade das amostras e a fidelidade ao prompt. A contrapartida é a velocidade de geração: cada resultado requer múltiplas iterações de remoção de ruído em vez de uma única passagem direta. É por isso que as gerações baseadas em difusão custam o que custam.
Relacionado
Inference steps
O número de passagens iterativas de refinamento que o modelo dá para produzir um resultado. Mais passos significam geralmente maior qualidade, com retornos decrescentes acima de um limiar específico de cada modelo.
CFG scale
Um parâmetro que controla com que rigor o modelo segue o prompt de texto. CFG mais alto = interpretação mais literal; CFG mais baixo = mais liberdade criativa. Intervalo típico de 4 a 12.
Text-to-image
Um modo de geração em que a entrada é texto (o prompt) e a saída é uma imagem. O modo mais comum de geração de imagem por IA.