Glosario
Inference steps
También conocido como: sampling steps, denoising steps
El número de pasadas de refinamiento iterativo que da el modelo para producir una salida. Más pasos generalmente significa mayor calidad, con rendimientos decrecientes por encima de un umbral específico del modelo.
En profundidad
Qué significa en la práctica
Los modelos de difusión de imagen generan la salida partiendo de ruido aleatorio y eliminándolo de forma iterativa. Cada iteración es un "paso". Los recuentos de pasos típicos van de 20 (vista previa rápida) a 50+ (alta calidad). Por encima de ~50 pasos la ganancia de calidad suele ser invisible y el coste de generación aumenta linealmente.
Los modelos de vídeo siguen un patrón similar, pero el recuento de pasos suele abstraerse: Sora 2, Kling y Veo exponen todos un único parámetro de "calidad" en lugar del recuento bruto de pasos. Para los modelos que exponen los pasos directamente (SDXL, FLUX), el valor por defecto está ajustado para el equilibrio correcto entre calidad y velocidad; los usuarios rara vez necesitan modificarlo.
Relacionado
CFG scale
Un parámetro que controla con qué fidelidad sigue el modelo el prompt de texto. Un CFG más alto = interpretación más literal; un CFG más bajo = más libertad creativa. Rango típico de 4 a 12.
Seed
Un valor numérico que inicializa el generador de números aleatorios dentro de un modelo. Fijar la seed hace que las salidas sean reproducibles: el mismo prompt + la misma seed dan la misma salida.
Diffusion model
Una clase de modelos generativos de IA que aprenden a invertir un proceso de adición de ruido: parten de ruido puro y lo eliminan progresivamente hasta obtener una imagen o vídeo que coincide con el prompt.