Glosario
Diffusion model
Una clase de modelos generativos de IA que aprenden a invertir un proceso de adición de ruido: parten de ruido puro y lo eliminan progresivamente hasta obtener una imagen o vídeo que coincide con el prompt.
En profundidad
Qué significa en la práctica
Los modelos de difusión son la arquitectura dominante para la generación de imágenes con IA a fecha de 2026. Modelos como Stable Diffusion (SDXL), FLUX y Nano Banana 2 se basan todos en difusión. Los modelos de vídeo como Sora 2 y Kling extienden la idea de la difusión al espacio-tiempo: eliminan el ruido de un volumen de ruido para producir una secuencia coherente de fotogramas.
La ventaja central de los modelos de difusión sobre arquitecturas anteriores (GANs, VAEs) es la calidad de las muestras y la fidelidad al prompt. La contrapartida es la velocidad de generación: cada salida requiere múltiples iteraciones de eliminación de ruido en lugar de una sola pasada hacia delante. Por eso las generaciones basadas en difusión cuestan lo que cuestan.
Relacionado
Inference steps
El número de pasadas de refinamiento iterativo que da el modelo para producir una salida. Más pasos generalmente significa mayor calidad, con rendimientos decrecientes por encima de un umbral específico del modelo.
CFG scale
Un parámetro que controla con qué fidelidad sigue el modelo el prompt de texto. Un CFG más alto = interpretación más literal; un CFG más bajo = más libertad creativa. Rango típico de 4 a 12.
Text-to-image
Un modo de generación en el que la entrada es texto (el prompt) y la salida es una imagen. El modo de generación de imágenes con IA más común.