Text-To-Imageとは
Text-To-Imageとは、テキストによる指示(プロンプト)を入力として、対応する画像を生成する技術の総称です。Diffusion Modelが主流手法として用いられます。
この用語はG検定シラバスの「32. マルチモーダル」に含まれます。 章全体の用語は用語解説⑤(全133語)にまとまっています。
一言でいうと
文章で指示すると、その内容の画像を作ってくれる技術の総称です。
2つの要素が必要
言語と画像という異なるモダリティを橋渡しする点がマルチモーダル技術の代表例といえます。DALL-Eが代表的なモデルです。
プロンプトが結果を左右する
同じモデルでも、指示の書き方で出力は大きく変わります。望む結果を得るための書き方の工夫はプロンプトエンジニアリングと呼ばれます。
これはモデルを変えずに性能を引き出すという新しいタイプの技能でもあります。
社会的な影響
誰でも高品質な画像を作れるようになったことで、クリエイターの権利や仕事のあり方をめぐる議論が起きています。
学習データに使われた作品の扱いも含め、技術と社会制度の調整が進行中の論点です。
混同しやすい用語との違い
| 用語 | ポイント |
|---|---|
| Text-To-Image | テキスト → 画像 |
| Image Captioning | 画像 → テキスト |
🎯 G検定での押さえどころ
- テキスト → 画像を生成する技術の総称
- 主流手法は拡散モデル
- テキスト理解と画像生成の組み合わせ
⚠️ よくある誤りの選択肢
- 「Text-To-Imageは画像を説明する文章を生成する技術である」→ 誤り。向きが逆です
関連する用語
ご利用にあたって 本ページの内容は、JDLAが公開しているG検定シラバス2024や公式テキストなど、一般に公開されている情報をもとに独自に整理・解説したものです。実際の試験の出題内容を示すものではなく、また合格を保証するものでもありません。制度・法令・試験要項は変更されることがあるため、最新の情報は必ずJDLA公式サイトでご確認ください。