Glosario
Video generation
También conocido como: AI video, video synthesis
Creación mediante IA de clips de vídeo a partir de prompts de texto, imágenes de referencia o ambos. La salida suele ser un clip corto (5-10 segundos) a resolución fija.
En profundidad
Qué significa en la práctica
La generación de vídeo con IA es un campo más joven que la generación de imágenes con IA, con los primeros modelos comercialmente viables (Runway Gen-2, Pika, Kling 1.0) apareciendo en 2023-2024. La generación de 2025-2026 (Sora 2, Kling v2.6 Pro, Veo 3.1) alcanza una calidad cercana a 1080p en duraciones de 5-10 segundos.
La duración sigue siendo la limitación dominante. La ventana de 10 segundos de Sora 2 es la salida de toma única más larga disponible; la mayoría de los demás modelos topan en 5 segundos. Para duraciones más largas se encadenan clips, lo que añade cortes visibles. La generación de vídeo también cuesta sustancialmente más por segundo de salida que la generación de imágenes: el precio típico es de 10 a 80 veces mayor por unidad de salida.
Relacionado
Image-to-video
Un modo de generación en el que la entrada es una imagen fija y la salida es un vídeo que anima esa imagen. A menudo se acompaña de un prompt de texto que describe el movimiento deseado.
Text-to-image
Un modo de generación en el que la entrada es texto (el prompt) y la salida es una imagen. El modo de generación de imágenes con IA más común.
Aspect ratio
La relación entre el ancho y el alto de una imagen o vídeo generado. Relaciones comunes: 1:1 (cuadrado), 9:16 (vertical / TikTok / Reels), 16:9 (horizontal / YouTube), 4:5 (retrato de Instagram), 3:4 (vertical editorial).