報酬成形とは
報酬成形とは、ゴール到達時のみ報酬が得られる難課題に対し、途中経過にも小さな報酬を与える設計手法です。学習初期の探索停滞(報酬スパース問題)を防ぎます。
この用語はG検定シラバスの「29. 深層強化学習」に含まれます。 章全体の用語は用語解説⑤(全133語)にまとまっています。
一言でいうと
ゴールまで遠い課題で、途中の進歩にも報酬を与えて学習を進みやすくする工夫です。
報酬スパース問題
迷路の出口に着いたときだけ報酬がもらえる設定を考えてみてください。偶然たどり着くまで報酬はゼロです。
手がかりが何もないため、エージェントは何を改善すべきか分かりません。課題が複雑になるほどこの問題は深刻になります。
設計を誤ると危険
途中に報酬を置けば学習は進みますが、置き方を間違えると意図しない行動を学習します。
「前進すると報酬」と設計すれば、ゴールに向かわずその場でぐるぐる回り続けることもあり得ます。報酬設計はAIの振る舞いを直接決めるため、慎重さが求められる作業です。
報酬設計は目的の設計
報酬をどう設計するかは「何を望ましいとするか」を決めることそのものです。
技術的な調整に見えて、実質的には価値判断を含みます。AIの目的設定をめぐる倫理的な議論ともつながる論点です。
🎯 G検定での押さえどころ
- 途中経過にも小さな報酬を与える
- 報酬スパース問題への対処
- 設計を誤ると意図しない行動を学習する
⚠️ よくある誤りの選択肢
- 「報酬成形を行えば必ず望ましい行動が学習される」→ 誤り。設計を誤ると逆効果になります
📘 もっと深く学ぶ
- 数式レベルまで踏み込んだ解説 → 医療AIナビ「強化学習の基礎」(E資格向け)
関連する用語
ご利用にあたって 本ページの内容は、JDLAが公開しているG検定シラバス2024や公式テキストなど、一般に公開されている情報をもとに独自に整理・解説したものです。実際の試験の出題内容を示すものではなく、また合格を保証するものでもありません。制度・法令・試験要項は変更されることがあるため、最新の情報は必ずJDLA公式サイトでご確認ください。