G検定対策
⑥ AIの社会実装と数理・統計 / 36. データの収集・加工・分析・学習

データリーケージとは

データリーケージとは、学習データの中に、本来テスト時まで知る由もない将来情報が誤って混入し、実力以上の評価が出てしまう現象です。汎化性能の過大評価を引き起こす重大な問題です。

この用語はG検定シラバスの「36. データの収集・加工・分析・学習」に含まれます。 章全体の用語は用語解説⑥(全52語)にまとまっています。

一言でいうと

知ってはいけない情報が学習データに紛れ込み、実力以上の成績が出てしまう現象です。

よくある例

いずれも本番では手に入らない情報を使ってしまっています。

なぜ危険なのか

検証では高い精度が出るため、問題に気づかないまま本番へ進みます。そして運用してから性能が出ないことが判明します。

対策は前処理を分割後に行う・時系列は時間で分割する・特徴量の由来を確認することです。交差検証でも同じ注意が必要になります。

防ぐための基本

精度が不自然に高いときはまずリークを疑う——実務でよく言われる経験則です。

🎯 G検定での押さえどころ

  • 本来知り得ない情報が混入し過大評価される
  • 前処理は分割後に行う
  • 時系列は時間で分割する

⚠️ よくある誤りの選択肢

  • 「データリーケージが起きると検証時の精度が低くなる」→ 誤り。高く出てしまう点が問題です
  • 「標準化は分割前に全データで行うのが正しい」→ 誤り。リーケージの原因になります
この用語を覚えたら チェックは章ページと「試験内容解説」TOPの進捗にも反映されます

関連する用語

スポンサーリンク

ご利用にあたって 本ページの内容は、JDLAが公開しているG検定シラバス2024や公式テキストなど、一般に公開されている情報をもとに独自に整理・解説したものです。実際の試験の出題内容を示すものではなく、また合格を保証するものでもありません。制度・法令・試験要項は変更されることがあるため、最新の情報は必ずJDLA公式サイトでご確認ください。

\ 公式LINE・登録無料 /

友だち追加で4大特典をプレゼント中🎁

E資格ミニ模試(全15問)/覚えておくべき数式チェック49本
医療現場の生成AI安全活用ガイド/医療AI用語事典100

📱 友だち追加して特典を受け取る

▶ 特典のくわしい内容を見る