G検定対策
⑤ ディープラーニングの応用例 / 32. マルチモーダル

Text-To-Imageとは

Text-To-Imageとは、テキストによる指示(プロンプト)を入力として、対応する画像を生成する技術の総称です。Diffusion Modelが主流手法として用いられます。

この用語はG検定シラバスの「32. マルチモーダル」に含まれます。 章全体の用語は用語解説⑤(全133語)にまとまっています。

一言でいうと

文章で指示すると、その内容の画像を作ってくれる技術の総称です。

2つの要素が必要

言語と画像という異なるモダリティを橋渡しする点がマルチモーダル技術の代表例といえます。DALL-Eが代表的なモデルです。

プロンプトが結果を左右する

同じモデルでも、指示の書き方で出力は大きく変わります。望む結果を得るための書き方の工夫はプロンプトエンジニアリングと呼ばれます。

これはモデルを変えずに性能を引き出すという新しいタイプの技能でもあります。

社会的な影響

誰でも高品質な画像を作れるようになったことで、クリエイターの権利や仕事のあり方をめぐる議論が起きています。

学習データに使われた作品の扱いも含め、技術と社会制度の調整が進行中の論点です。

混同しやすい用語との違い

用語ポイント
Text-To-Imageテキスト → 画像
Image Captioning画像 → テキスト

🎯 G検定での押さえどころ

  • テキスト → 画像を生成する技術の総称
  • 主流手法は拡散モデル
  • テキスト理解と画像生成の組み合わせ

⚠️ よくある誤りの選択肢

  • 「Text-To-Imageは画像を説明する文章を生成する技術である」→ 誤り。向きが逆です
この用語を覚えたら チェックは章ページと「試験内容解説」TOPの進捗にも反映されます

関連する用語

スポンサーリンク

ご利用にあたって 本ページの内容は、JDLAが公開しているG検定シラバス2024や公式テキストなど、一般に公開されている情報をもとに独自に整理・解説したものです。実際の試験の出題内容を示すものではなく、また合格を保証するものでもありません。制度・法令・試験要項は変更されることがあるため、最新の情報は必ずJDLA公式サイトでご確認ください。

\ 公式LINE・登録無料 /

友だち追加で4大特典をプレゼント中🎁

E資格ミニ模試(全15問)/覚えておくべき数式チェック49本
医療現場の生成AI安全活用ガイド/医療AI用語事典100

📱 友だち追加して特典を受け取る

▶ 特典のくわしい内容を見る