G検定対策
⑧ AI倫理と社会的課題 / 11. 安全性とセキュリティ

データ汚染とは

データ汚染とは、学習データに悪意のあるデータを混入させ、AIの学習結果を意図的に歪める攻撃手法です。特定条件で誤作動を起こすバックドア攻撃の実現手段として用いられます。

この用語はG検定シラバスの「11. 安全性とセキュリティ」に含まれます。 章全体の用語は用語解説⑧(全45語)にまとまっています。

一言でいうと

学習データに毒を混ぜ込んで、AIの学習結果をわざと狂わせる攻撃です。

バックドアという仕掛け

単に精度を下げるだけなら気づかれやすくなります。より巧妙なのは特定の合図があるときだけ誤作動させる手口です。

通常時は正常に動くため検証をすり抜けます。しかし攻撃者が決められた模様や文字列を入力すると意図した誤判定が起きる——これがバックドア攻撃です。

混入しやすい経路

データを外部から集めるほどリスクが上がるという構図になっています。

対策

収集段階での出所の確認と検証が基本です。統計的に不自然なデータを検出する手法も研究されています。

またMLOpsの仕組みでデータの来歴を記録しておけば、問題が起きたときに原因を追跡できますトレーサビリティの確保が防御の一部になります。

混同しやすい用語との違い

用語ポイント
データ汚染学習データに悪意あるデータを混入させる
モデル汚染モデル本体や更新プロセスを不正に改変する

🎯 G検定での押さえどころ

  • 学習データに悪意あるデータを混入させる
  • バックドア攻撃の実現手段
  • データ収集・管理段階での検証と監視が重要

⚠️ よくある誤りの選択肢

  • 「データ汚染とは、学習済みモデルのファイルを直接書き換える攻撃である」→ 誤り。それはモデル汚染です。データ汚染は学習データへの混入を指します

関連する用語

スポンサーリンク

ご利用にあたって 本ページの内容は、JDLAが公開しているG検定シラバス2024や公式テキストなど、一般に公開されている情報をもとに独自に整理・解説したものです。実際の試験の出題内容を示すものではなく、また合格を保証するものでもありません。制度・法令・試験要項は変更されることがあるため、最新の情報は必ずJDLA公式サイトでご確認ください。

\ 公式LINE・登録無料 /

友だち追加で4大特典をプレゼント中🎁

E資格ミニ模試(全15問)/覚えておくべき数式チェック49本
医療現場の生成AI安全活用ガイド/医療AI用語事典100

📱 友だち追加して特典を受け取る

▶ 特典のくわしい内容を見る