用語集
In-image text
別名:text rendering, in-frame text
シーンの一部として生成画像の内側に現れるテキストです。看板、パッケージの文言、引用カード、インフォグラフィックのラベルなど。歴史的に拡散モデルの弱点でしたが、2026 年では最も強力なモデルだけが読みやすく描画できます。
詳しく
実際の意味
2022〜2024 年の AI 画像生成の時代のほとんどにおいて、画像内テキストはおおむね意味不明な文字列でした。文字の形をした記号で、読める単語というより並行世界のアルファベットの文字のように見えたのです。Nano Banana 2(2025)と最新の FLUX チェックポイントはラテン文字についてこれを解決しました。Nano Banana 2 はさらに非ラテン文字(中国語、日本語、アラビア語、キリル文字)にもクラス最高水準の忠実度で対応しています。
読みやすいテキストが必要な出力(引用カード、パッケージのモックアップ、確立ショットの看板、インフォグラフィックのデータラベル、テキストオーバーレイ付きの SNS 投稿)には、コンシューマー帯では Nano Banana 2 が唯一の実用的な選択肢です。他のモデルはビジュアルは生成できますが、テキストの読みやすさは失われます。
関連項目
Identity preservation
同じ参照画像からの複数回の生成にわたって、人物の顔やキャラクターの外見を一貫して保つモデルの能力です。複数パネルのコラージュやキャラクター主導のコンテンツにとって極めて重要です。
Output resolution
生成される画像や動画のピクセル寸法です。一般的な値は 1024×1024(ほとんどの画像モデルのデフォルト)、4K(Nano Banana 2 のポートレート)、1080p(ほとんどの動画モデル)です。
Prompt
何を生成するかを記述して AI モデルに与えるテキストの指示です。画像・動画モデルでは、プロンプトに被写体の説明、スタイルの方向性、カメラや構図のヒント、そして任意のネガティブプロンプトを混在させます。