データの偏りとは
データの偏りとは、現実社会に存在する偏見や不平等が学習データに反映されてしまうことです。これを学習したAIは差別的判断を再生産・増幅する恐れがあり、倫理的に大きな問題となります。
この用語はG検定シラバスの「10. 公平性」に含まれます。 章全体の用語は用語解説⑧(全45語)にまとまっています。
一言でいうと
過去の社会にあった偏見が、そのままデータに残ってしまっている状態です。
Amazonの採用AI事例
過去10年分の履歴書と採用結果を学習させた採用支援AIが、女性候補者を不利に評価するようになったと報じられた事例が知られています。
技術者の応募が男性中心だった時代のデータを学習した結果、「女性」を示唆する語を含む履歴書の評価を下げる挙動が確認されたとされます。
このシステムは運用に至らず取りやめとなりました。G検定で代表的な事例です。
AIは偏見を増幅する
人間の判断なら「今回は事情が違う」と例外を認めることがあります。
しかしAIは統計的な傾向をそのまま強める方向に働きます。少数派のデータは誤差として切り捨てられやすいためです。
「機械だから客観的」という思い込みは危険だ——という教訓につながります。
対策と限界
ただし社会の偏りそのものは技術では解消できません。何を公平とするかの判断が常に伴います。
🎯 G検定での押さえどころ
- 現実社会の偏見が学習データに反映される
- 差別的判断を再生産・増幅する
- Amazonの採用AIの事例が重要
⚠️ よくある誤りの選択肢
- 「AIは統計的に処理するため人間より客観的な判断ができる」→ 誤り。データの偏りを増幅します
関連する用語
ご利用にあたって 本ページの内容は、JDLAが公開しているG検定シラバス2024や公式テキストなど、一般に公開されている情報をもとに独自に整理・解説したものです。実際の試験の出題内容を示すものではなく、また合格を保証するものでもありません。制度・法令・試験要項は変更されることがあるため、最新の情報は必ずJDLA公式サイトでご確認ください。