PSPNetとは
PSPNetとは、Pyramid Pooling Moduleを導入し、広域な文脈情報を考慮することで高精度なセグメンテーションを実現するモデルです。
この用語はG検定シラバスの「26. 画像認識」に含まれます。 章全体の用語は用語解説⑤(全133語)にまとまっています。
一言でいうと
画像全体の文脈を複数のスケールで捉えて、判定精度を高めるモデルです。
文脈が必要な理由
小さな領域だけを見ると、「船」と「車」を取り違えることがあります。形が似ているためです。
しかし周囲が水面なら船、道路なら車だと判断できます。局所の見た目だけでなく全体の状況を踏まえることが精度向上の鍵になります。
Pyramid Pooling Module
特徴マップを複数の粗さでプーリングし、それらを統合します。細かい情報と大まかな全体像を同時に持てるようになります。
複数スケールを扱うという発想はFPNやGoogLeNetのInceptionとも共通しており、画像処理でくり返し現れる基本的な工夫です。
大域と局所の両立
セグメンテーションの難しさは「広く見る」と「細かく見る」の両立にあります。
PSPNetは複数スケールのプーリングで、DeepLabは空洞畳み込みでこれに対処しました。アプローチは違うが目的は同じと整理できます。
🎯 G検定での押さえどころ
- Pyramid Pooling Moduleを導入
- 広域の文脈情報を考慮する
- 複数スケールを統合するという発想
⚠️ よくある誤りの選択肢
- 「PSPNetは局所的な情報のみを用いる」→ 誤り。広域の文脈を重視します
📘 もっと深く学ぶ
- 数式レベルまで踏み込んだ解説 → 医療AIナビ「FCN・U-Net」(E資格向け)
関連する用語
ご利用にあたって 本ページの内容は、JDLAが公開しているG検定シラバス2024や公式テキストなど、一般に公開されている情報をもとに独自に整理・解説したものです。実際の試験の出題内容を示すものではなく、また合格を保証するものでもありません。制度・法令・試験要項は変更されることがあるため、最新の情報は必ずJDLA公式サイトでご確認ください。