G検定対策
② 機械学習の概要 / 9. 強化学習

Q 学習とは

Q学習とは、行動価値関数Q(s,a)を学習して最適な方策を求める代表的な強化学習手法です。更新時に次状態で最大のQ値をとる行動を仮定するため、実際に選んだ行動に依存しない方策外学習(off-policy)になります。

この用語はG検定シラバスの「9. 強化学習」に含まれます。 章全体の用語は用語解説②(全62語)にまとまっています。

一言でいうと

「次はきっと最善手を打つ」と仮定してQ値を更新していく強化学習の手法です。

なぜ off-policy なのか

Q学習の更新では、次の状態で最も価値の高い行動をとった場合を仮定して計算します。

ところが実際のエージェントは、探索のためにε-greedy方策などでランダムな行動をとることがあります。

つまり「更新に使う行動」と「実際にとる行動」が一致しない——これがoff-policy(方策外学習)と呼ばれる理由です。

SARSAとの違い(最重要)

G検定で最も重要なのがこの対比です。

Q学習は理想的な行動を仮定するため学習が速い一方、探索中の失敗を考慮しないため危険な経路を選びやすい面があります。

DQNへの発展

Q学習はQ値を表として保持するため、状態が多い問題には適用できませんでした。

この表をニューラルネットワークに置き換えたのがDQNです。ゲーム画面のような複雑な入力からでもQ値を推定できるようになり、深層強化学習の扉を開いた手法として知られています。

混同しやすい用語との違い

用語ポイント
Q学習off-policy。次状態の最大Q値で更新。学習が速い
SARSAon-policy。実際に選んだ行動で更新。安定しやすい

🎯 G検定での押さえどころ

  • off-policy(方策外学習)である
  • 次状態で最大のQ値を仮定して更新する
  • SARSA(on-policy)との違いが最重要

⚠️ よくある誤りの選択肢

  • 「Q学習は方策内学習(on-policy)である」→ 誤り。off-policyです
  • 「Q学習は実際に選択した行動のQ値を使って更新する」→ 誤り。それはSARSAです

📘 もっと深く学ぶ

関連する用語

スポンサーリンク

ご利用にあたって 本ページの内容は、JDLAが公開しているG検定シラバス2024や公式テキストなど、一般に公開されている情報をもとに独自に整理・解説したものです。実際の試験の出題内容を示すものではなく、また合格を保証するものでもありません。制度・法令・試験要項は変更されることがあるため、最新の情報は必ずJDLA公式サイトでご確認ください。

\ 公式LINE・登録無料 /

友だち追加で4大特典をプレゼント中🎁

E資格ミニ模試(全15問)/覚えておくべき数式チェック49本
医療現場の生成AI安全活用ガイド/医療AI用語事典100

📱 友だち追加して特典を受け取る

▶ 特典のくわしい内容を見る