용어집
Video generation
다른 이름: AI video, video synthesis
텍스트 prompt, reference image, 또는 둘 다로부터 비디오 클립을 AI로 만드는 것입니다. 출력은 보통 고정 해상도의 짧은 클립(5-10초)입니다.
자세히
실제로 어떤 의미인가
AI 비디오 생성은 AI 이미지 생성보다 더 젊은 분야로, 상업적으로 실현 가능한 최초의 모델들(Runway Gen-2, Pika, Kling 1.0)이 2023-2024년에 등장했습니다. 2025-2026년 세대(Sora 2, Kling v2.6 Pro, Veo 3.1)는 5-10초 길이에서 거의 1080p에 가까운 품질에 도달합니다.
길이는 여전히 지배적인 제약입니다. Sora 2의 10초 구간은 이용 가능한 가장 긴 단일 컷 출력이며, 대부분의 다른 모델은 5초에서 멈춥니다. 더 긴 길이가 필요하면 클립을 이어 붙여야 하고, 이는 눈에 보이는 컷을 만듭니다. 비디오 생성은 또한 출력 1초당 비용이 이미지 생성보다 상당히 비쌉니다 — 일반적인 가격은 출력 단위당 10-80배 높습니다.
관련 항목
Image-to-video
입력이 정지 이미지이고 출력이 그 이미지를 애니메이션화한 비디오인 생성 모드입니다. 원하는 움직임을 묘사하는 텍스트 prompt와 함께 쓰이는 경우가 많습니다.
Text-to-image
입력이 텍스트(prompt)이고 출력이 이미지인 생성 모드입니다. 가장 흔한 AI 이미지 생성 모드입니다.
Aspect ratio
생성된 이미지나 비디오의 가로 대 세로 비율입니다. 흔한 비율: 1:1(정사각형), 9:16(세로 / TikTok / Reels), 16:9(가로 / YouTube), 4:5(Instagram 세로), 3:4(에디토리얼 세로).