G検定対策
② 機械学習の概要 / 10. モデルの選択・評価

過学習とは

過学習とは、訓練データに過度に適合してしまい、未知データでの性能が低下する現象です。汎化性能の低下とセットで理解することが重要です。

この用語はG検定シラバスの「10. モデルの選択・評価」に含まれます。 章全体の用語は用語解説②(全62語)にまとまっています。

一言でいうと

手元のデータを覚えすぎて、新しいデータに対応できなくなる現象です。

なぜ起きるのか

モデルが複雑すぎたり、データが少なすぎたりすると、モデルはデータに含まれる偶然のばらつきやノイズまで再現しようとします。

その結果、訓練データの誤差は下がり続けるのに、未知データでの誤差は途中から上がり始めます。この乖離が過学習のサインです。

過少適合(未学習)との違い

逆に、モデルが単純すぎてデータの傾向を捉えきれない状態を過少適合(未学習)といいます。

両者は訓練データでの精度を見れば区別できます

対策

学習曲線で見分ける

過学習が起きているかは、訓練データと検証データの誤差を並べて見るとはっきり分かります。

検証誤差が悪化し始めた時点で学習を止める「早期終了」も有効な対策です。

学習曲線。訓練誤差は下がり続けるが、検証誤差は途中から上がり始める。その分岐点が過学習の開始点
訓練データの誤差だけを見ていても過学習は分からない。検証データの誤差が下げ止まって上がり始めた時点が過学習の開始点で、そこで学習を止めるのが「早期終了」。両方とも高いままなら過少適合(未学習)。

混同しやすい用語との違い

用語ポイント
過学習訓練データの精度は高い/未知データで低い
過少適合(未学習)訓練データでも未知データでも精度が低い

🎯 G検定での押さえどころ

  • 訓練データの精度は高いが未知データで低い
  • 過少適合(両方低い)との区別
  • 対策は正則化・データ増加・特徴量削減・アンサンブル

⚠️ よくある誤りの選択肢

  • 「過学習では訓練データの精度も低くなる」→ 誤り。訓練データの精度は高くなります
  • 「データを増やすと過学習しやすくなる」→ 誤り。抑える方向に働きます

📘 もっと深く学ぶ

関連する用語

スポンサーリンク

ご利用にあたって 本ページの内容は、JDLAが公開しているG検定シラバス2024や公式テキストなど、一般に公開されている情報をもとに独自に整理・解説したものです。実際の試験の出題内容を示すものではなく、また合格を保証するものでもありません。制度・法令・試験要項は変更されることがあるため、最新の情報は必ずJDLA公式サイトでご確認ください。

\ 公式LINE・登録無料 /

友だち追加で4大特典をプレゼント中🎁

E資格ミニ模試(全15問)/覚えておくべき数式チェック49本
医療現場の生成AI安全活用ガイド/医療AI用語事典100

📱 友だち追加して特典を受け取る

▶ 特典のくわしい内容を見る