Multi-Head Attentionとは
Multi-Head Attentionとは、Self-Attentionを複数のヘッドで並列実行し、異なる観点から情報を捉える仕組みです。表現力を大幅に向上させます。
この用語はG検定シラバスの「23. Attention」に含まれます。 章全体の用語は用語解説④(全60語)にまとまっています。
一言でいうと
複数の「視点」で同時にAttentionを計算し、結果をまとめる仕組みです。
なぜ複数に分けるのか
1つのAttentionでは、単語の関係を1通りの見方でしか捉えられません。
しかし言語の関係は多面的です。構文的なつながり、意味的な近さ、位置関係——これらを同時に捉えたい場面があります。
Multi-Head Attentionは複数のヘッドがそれぞれ異なる観点を担当し、結果を連結して最終出力にします。
仕組み
各ヘッドは異なる線形変換を通したQ・K・Vを使います。変換が違うので、注目する関係も自然に変わります。
得られた各ヘッドの出力を連結し、もう一度線形変換して最終出力を作ります。ヘッドは並列に計算できるため速度を落とさずに表現力だけを上げられるのが優れた点です。
ヘッドの数
ヘッド数は8や12といった値がよく使われます。全体の次元数をヘッド数で割って各ヘッドに割り当てるため、ヘッドを増やしても総計算量はあまり変わりません。
「増やしてもコストが増えない」という性質が、複数の観点を持たせる工夫を現実的にしています。
🎯 G検定での押さえどころ
- 複数のヘッドで並列にAttentionを計算
- 各ヘッドは異なる線形変換のQ・K・Vを使う
- 出力を連結して表現力を高める
⚠️ よくある誤りの選択肢
- 「Multi-Head Attentionは各ヘッドを順番に計算する」→ 誤り。並列に計算します
- 「各ヘッドは同じQ・K・Vを使う」→ 誤り。異なる線形変換を通した値を使います
📘 もっと深く学ぶ
- 数式レベルまで踏み込んだ解説 → 医療AIナビ「Transformer」(E資格向け)
- 手を動かして確かめる → Attention可視化シミュレータ
関連する用語
ご利用にあたって 本ページの内容は、JDLAが公開しているG検定シラバス2024や公式テキストなど、一般に公開されている情報をもとに独自に整理・解説したものです。実際の試験の出題内容を示すものではなく、また合格を保証するものでもありません。制度・法令・試験要項は変更されることがあるため、最新の情報は必ずJDLA公式サイトでご確認ください。