용어집
Text-to-image
다른 이름: T2I, txt2img
입력이 텍스트(prompt)이고 출력이 이미지인 생성 모드입니다. 가장 흔한 AI 이미지 생성 모드입니다.
자세히
실제로 어떤 의미인가
text-to-image는 대부분의 이미지 모델에서 기본값입니다. 모델은 글로 쓴 묘사를 받아 그에 맞는 이미지를 만듭니다. Nano Banana 2는 hilens에서 text-to-image를 지원하며, HiDream-O1-image-1.5가 뒤이어 추가될 예정으로 발표되었습니다.
text-to-image는 image-to-image(입력이 기존 이미지 + 선택적 prompt이고, 모델이 수정된 버전을 만듦) 및 image-to-video(입력이 이미지이고, 모델이 비디오를 만듦)와 대비됩니다. 동일한 모델이 별개의 모델이 아니라 서로 다른 파라미터 설정을 통해 여러 모드를 지원하는 경우가 많습니다.
관련 항목
Prompt
무엇을 생성할지 설명하기 위해 AI 모델에 주는 텍스트 지시문입니다. 이미지와 비디오 모델의 경우, prompt는 피사체 묘사, 스타일 방향, 카메라나 구도 힌트, 그리고 선택적인 negative prompt를 섞습니다.
Image-to-video
입력이 정지 이미지이고 출력이 그 이미지를 애니메이션화한 비디오인 생성 모드입니다. 원하는 움직임을 묘사하는 텍스트 prompt와 함께 쓰이는 경우가 많습니다.
Reference image
생성을 조건화하기 위해 prompt와 함께 업로드하는 이미지입니다. 모델은 구도, 색상 팔레트, 피사체의 닮음새, 프레이밍 등 시각적 속성을 reference에서 출력으로 보존합니다.