潜在的ディリクレ配分法 (LDA)とは
LDAとは、文書が複数のトピック(話題)の確率的な混合によって生成されると仮定する、代表的な教師なし学習の確率モデルです。正解ラベルなしで文書集合の話題構造を推定できる点が特徴です。
この用語はG検定シラバスの「8. 教師なし学習」に含まれます。 章全体の用語は用語解説②(全62語)にまとまっています。
一言でいうと
「1つの文書は複数の話題が混ざってできている」と考えて、話題の構造を推定するモデルです。
2種類の確率分布
LDAでは、次の2つを推定します。ここが仕組みの核心です。
- 各文書=トピックの確率分布(この記事は政治60%・経済40%、など)
- 各トピック=単語の確率分布(政治トピックでは「選挙」「議員」が出やすい、など)
重要なのは、1つの文書が1つの話題に決め打ちされないことです。複数の話題が割合として混ざっていると考えます。
略称の重複に注意
LDAという略称は、教師あり学習の「線形判別分析(Linear Discriminant Analysis)」にも使われます。
G検定の文脈でトピックモデルの話題であれば潜在的ディリクレ配分法を指します。文脈で判断してください。
「ディリクレ」とは何か
ディリクレ分布とは、「割合の組み合わせ」そのものを確率的に扱うための分布です。
LDAでは「この文書は政治60%・経済40%」といった割合の出方を、この分布から生まれると仮定します。話題の混ざり方に事前の仮定を置いている点が、名前に「ディリクレ」が入っている理由です。
🎯 G検定での押さえどころ
- 文書はトピックの確率的な混合として生成されると仮定
- 各文書=トピック分布、各トピック=単語分布
- 教師なし学習である
⚠️ よくある誤りの選択肢
- 「LDAでは1つの文書に1つのトピックだけが割り当てられる」→ 誤り。複数の混合として表します
- 「LDAは教師あり学習である」→ 誤り。教師なし学習です
関連する用語
ご利用にあたって 本ページの内容は、JDLAが公開しているG検定シラバス2024や公式テキストなど、一般に公開されている情報をもとに独自に整理・解説したものです。実際の試験の出題内容を示すものではなく、また合格を保証するものでもありません。制度・法令・試験要項は変更されることがあるため、最新の情報は必ずJDLA公式サイトでご確認ください。