データ汚染とは
データ汚染とは、学習データに悪意のあるデータを混入させ、AIの学習結果を意図的に歪める攻撃手法です。特定条件で誤作動を起こすバックドア攻撃の実現手段として用いられます。
この用語はG検定シラバスの「11. 安全性とセキュリティ」に含まれます。 章全体の用語は用語解説⑧(全45語)にまとまっています。
一言でいうと
学習データに毒を混ぜ込んで、AIの学習結果をわざと狂わせる攻撃です。
バックドアという仕掛け
単に精度を下げるだけなら気づかれやすくなります。より巧妙なのは特定の合図があるときだけ誤作動させる手口です。
通常時は正常に動くため検証をすり抜けます。しかし攻撃者が決められた模様や文字列を入力すると意図した誤判定が起きる——これがバックドア攻撃です。
混入しやすい経路
- Webからの自動収集:誰でも投稿できる場から集めたデータ
- クラウドソーシング:外部の作業者によるアノテーション
- ユーザー入力の学習利用:悪意ある入力が繰り返される
データを外部から集めるほどリスクが上がるという構図になっています。
対策
収集段階での出所の確認と検証が基本です。統計的に不自然なデータを検出する手法も研究されています。
またMLOpsの仕組みでデータの来歴を記録しておけば、問題が起きたときに原因を追跡できます。トレーサビリティの確保が防御の一部になります。
混同しやすい用語との違い
| 用語 | ポイント |
|---|---|
| データ汚染 | 学習データに悪意あるデータを混入させる |
| モデル汚染 | モデル本体や更新プロセスを不正に改変する |
🎯 G検定での押さえどころ
- 学習データに悪意あるデータを混入させる
- バックドア攻撃の実現手段
- データ収集・管理段階での検証と監視が重要
⚠️ よくある誤りの選択肢
- 「データ汚染とは、学習済みモデルのファイルを直接書き換える攻撃である」→ 誤り。それはモデル汚染です。データ汚染は学習データへの混入を指します
関連する用語
ご利用にあたって 本ページの内容は、JDLAが公開しているG検定シラバス2024や公式テキストなど、一般に公開されている情報をもとに独自に整理・解説したものです。実際の試験の出題内容を示すものではなく、また合格を保証するものでもありません。制度・法令・試験要項は変更されることがあるため、最新の情報は必ずJDLA公式サイトでご確認ください。