用語集
Text-to-image
別名:T2I, txt2img
入力がテキスト(プロンプト)で、出力が画像となる生成モードです。最も一般的な AI 画像生成モードです。
詳しく
実際の意味
text-to-image はほとんどの画像モデルのデフォルトです。モデルは書かれた説明を受け取り、それに合致する画像を生成します。Nano Banana 2 は hilens 上で text-to-image に対応しており、HiDream-O1-image-1.5 が続く予定として発表されています。
text-to-image は image-to-image(入力は既存の画像と任意のプロンプトで、モデルが改変版を生成する)や image-to-video(入力は画像で、モデルが動画を生成する)とは対照的です。多くの場合、同じモデルが別々のモデルとしてではなく、異なるパラメータ設定を通じて複数のモードに対応します。
関連項目
Prompt
何を生成するかを記述して AI モデルに与えるテキストの指示です。画像・動画モデルでは、プロンプトに被写体の説明、スタイルの方向性、カメラや構図のヒント、そして任意のネガティブプロンプトを混在させます。
Image-to-video
入力が静止画で、その画像をアニメーション化した動画を出力する生成モードです。多くの場合、求める動きを記述するテキストプロンプトと組み合わせて使われます。
Reference image
生成を条件付けするためにプロンプトと一緒にアップロードする画像です。モデルは構図、カラーパレット、被写体の似姿、フレーミングといった視覚的特性を参照画像から出力に引き継ぎます。