オフライン強化学習とは
オフライン強化学習とは、環境との新たな試行錯誤を行わず、既に収集された固定データのみから方策を学習する手法です。試行錯誤が危険・高コスト・非倫理的な分野で重要になります。
この用語はG検定シラバスの「29. 深層強化学習」に含まれます。 章全体の用語は用語解説⑤(全133語)にまとまっています。
一言でいうと
新しく試すことなく、すでにあるデータだけで方策を学ぶ強化学習です。
なぜ必要なのか
通常の強化学習は試行錯誤が前提です。しかし現実には試せない領域があります。
- 医療:患者で試すことはできない
- 金融:失敗が実損失に直結する
- 製造:設備の破損リスクがある
こうした分野では過去の記録から学ぶしかありません。
外挿誤差という難しさ
データに含まれない行動については、その価値を推測するしかありません。しかも推測が過大だと、モデルはその行動を選びたがります。
実際に試して修正できないため、誤った推測が暴走したまま残ります(分布外行動の外挿誤差)。データにない行動を選ばないよう制約を加える工夫が必要です。
データの質に左右される
学べるのはデータに含まれる行動の範囲までです。記録された方策が下手なら、それを大きく超えることは困難です。
「良いデータがあるか」が性能を決めるという点で、通常の教師あり学習に近い性質を持ちます。
🎯 G検定での押さえどころ
- 新たな試行錯誤を行わず固定データから学ぶ
- 医療・金融・製造など試行が困難な分野で重要
- 分布外行動の外挿誤差が課題
⚠️ よくある誤りの選択肢
- 「オフライン強化学習でも環境との相互作用が必要である」→ 誤り。行わない点が定義です
📘 もっと深く学ぶ
- 数式レベルまで踏み込んだ解説 → 医療AIナビ「強化学習の基礎」(E資格向け)
関連する用語
ご利用にあたって 本ページの内容は、JDLAが公開しているG検定シラバス2024や公式テキストなど、一般に公開されている情報をもとに独自に整理・解説したものです。実際の試験の出題内容を示すものではなく、また合格を保証するものでもありません。制度・法令・試験要項は変更されることがあるため、最新の情報は必ずJDLA公式サイトでご確認ください。