AI Red Teaming
読み方は「エーアイレッドチーミング」。意味と使われ方を根拠つきで確認できます。
複数資料で一致
30秒で分かる答え
AI Red Teamingは、攻撃者や悪用者の視点でAIモデルやAIシステムへ試験を行い、危険な出力、情報漏えい、プロンプト攻撃、権限逸脱などの弱点を見つける方法です。問題を発見する活動であり、安全性を完全に証明するテストではありません。発見後の修正と再評価まで含めて運用します。
AIの弱点や悪用可能性を攻撃者目線で検証する方法
AI Red Teamingの意味・使い方
要点と背景
AIの弱点や悪用可能性を攻撃者目線で検証する方法
AI Red Teamingは、AIモデルやAIシステムに対して攻撃者の視点から意図的に失敗や悪用を試み、脆弱性、危険な出力、情報漏えい、権限逸脱、バイアス、プロンプトインジェクションなどを発見する評価方法です。NISTは、AIエージェントの大規模なレッドチーム競技を通じて、外部データに含まれる指示によるエージェント乗っ取りなどを調査しています。対象はモデル単体に限らず、プロンプト、検索、ツール、認証、データ、UI、ログ、実行環境を含むシステム全体になり得ます。テストケースは、既知の攻撃、利用者が想定する誤用、未知の入力、複数ステップの連鎖などを組み合わせ、成功条件と影響を記録します。Red Teamingを一度実施したから安全と証明されるわけではなく、攻撃手法、モデル、データ、権限が変わるたびに再評価が必要です。発見した問題を修正し、再発しないかEvalsや監視で確認する工程とセットで扱います。
使われる分野・文脈
掲載データの使用場面
確認時の注意
断定を避けるポイント
NISTのレッドチーム調査とAIリスク管理資料で、攻撃者目線の評価と、発見後の緩和・再評価を含む活動として確認した。安全性の証明とは扱わない。
関連する用語
同じ分野・使用文脈から探す
根拠資料と確認状況
確認日・出典
読み方と意味を、
分けて確認。
正式名称、意味、使われる分野を分けて記録しています。