情報検索とは
情報検索とは、大量の文書集合から、ユーザーの検索クエリに最も関連性の高い文書を抽出・順位付けする技術です。検索エンジンや社内文書検索の基盤になっています。
この用語はG検定シラバスの「27. 自然言語処理」に含まれます。 章全体の用語は用語解説⑤(全133語)にまとまっています。
一言でいうと
大量の文書から、探している内容に近いものを見つけて順番に並べる技術です。
古典的な手法
TF-IDFやBM25といった単語の一致にもとづくスコアリングが長く使われてきました。
計算が速く安定していますが、言葉が違えば同じ意味でもヒットしません。「車」で検索して「自動車」の文書が見つからないという問題です。
意味ベース検索
BERTなどで文書とクエリを分散表現に変換し、ベクトルの近さで検索する方式が発展しています。
言い回しが違っても意味が近ければヒットするため、検索の質が大きく向上しました。質問応答とも密接に関係します。
検索の評価
検索では上位に正解が来るかが重要です。単なる正解率では測れません。
そのため適合率・再現率を順位を考慮した形で評価する指標が使われます。タスクに合った評価指標を選ぶことの重要性がよく表れています。
🎯 G検定での押さえどころ
- クエリに関連する文書を抽出・順位づけする
- 古典的手法はTF-IDF・BM25
- 近年は意味ベース検索が発展
⚠️ よくある誤りの選択肢
- 「情報検索では単語の完全一致しか扱えない」→ 誤り。意味ベース検索が発展しています
📘 もっと深く学ぶ
- 数式レベルまで踏み込んだ解説 → 医療AIナビ「自然言語処理の概要」(E資格向け)
関連する用語
ご利用にあたって 本ページの内容は、JDLAが公開しているG検定シラバス2024や公式テキストなど、一般に公開されている情報をもとに独自に整理・解説したものです。実際の試験の出題内容を示すものではなく、また合格を保証するものでもありません。制度・法令・試験要項は変更されることがあるため、最新の情報は必ずJDLA公式サイトでご確認ください。