术语表
Video generation
又称:AI video, video synthesis
由 AI 驱动、根据文本 prompt、参考图或两者一起创建视频片段。输出通常是一段短片(5-10 秒),分辨率固定。
深入解读
在实践中意味着什么
AI 视频生成比 AI 图像生成更年轻,首批商业上可行的模型(Runway Gen-2、Pika、Kling 1.0)出现在 2023-2024 年。2025-2026 代(Sora 2、Kling v2.6 Pro、Veo 3.1)在 5-10 秒时长下达到了接近 1080p 的质量。
时长仍是主导性的约束。Sora 2 的 10 秒窗口是目前可用的最长单镜头输出;大多数其他模型上限为 5 秒。要更长的时长就得拼接片段,这会带来可见的剪切。视频生成每秒输出的成本也大幅高于图像生成 —— 典型定价是每单位输出高出 10-80 倍。
相关内容