Adversarial Attack (Adversarial Examples)とは
Adversarial Attack(敵対的攻撃)とは、人間にはほとんど認識できない微小なノイズを入力データに加え、AIを意図的に誤認識させる攻撃手法です。画像認識や音声認識で深刻な問題となっており、G検定対策としても重要です。
この用語はG検定シラバスの「11. 安全性とセキュリティ」に含まれます。 章全体の用語は用語解説⑧(全45語)にまとまっています。
一言でいうと
人には分からないわずかなノイズを加えて、AIにわざと間違えさせる攻撃です。
なぜ成立するのか
ニューラルネットワークは人間とは異なる特徴を手がかりに判断しています。
そのため人間には見分けがつかない変化でも、モデルにとっては大きく意味が変わることがあります。
パンダの画像に微小なノイズを加えるとテナガザルと判定される、といった例が有名です。
現実世界での脅威
- 道路標識にシールを貼り、自動運転車に誤認識させる
- 特定の模様を身につけて人物検出を回避する
- 音声に人間には聞こえない信号を混ぜ、音声アシスタントに命令を出す
安全性に直結する用途ほど影響が大きいため、重要な研究課題となっています。
対策
- ロバスト学習:敵対的サンプルを学習に含めて耐性を高める
- 入力検証:不自然なノイズを検出して弾く
- モデルの多重化:複数のモデルで判断して整合を確認する
ただし完全な防御は難しく、攻撃と防御のいたちごっこが続いています。セキュリティ・バイ・デザインの発想が求められる領域です。
🎯 G検定での押さえどころ
- 微小なノイズで意図的に誤認識させる
- 画像認識・音声認識で深刻な問題
- ロバスト学習・入力検証が対策
⚠️ よくある誤りの選択肢
- 「敵対的攻撃は、人間の目にも明らかなノイズを加えて誤認識させる手法である」→ 誤り。人間にはほとんど認識できない微小なノイズを用います
関連する用語
ご利用にあたって 本ページの内容は、JDLAが公開しているG検定シラバス2024や公式テキストなど、一般に公開されている情報をもとに独自に整理・解説したものです。実際の試験の出題内容を示すものではなく、また合格を保証するものでもありません。制度・法令・試験要項は変更されることがあるため、最新の情報は必ずJDLA公式サイトでご確認ください。