AI Red Teamingの意味
AI Red Teaming
エーアイレッドチーミング複数資料で一致
AI Red Teamingとは
AI Red Teamingは、攻撃者や悪用者の視点でAIモデルやAIシステムへ試験を行い、危険な出力、情報漏えい、プロンプト攻撃、権限逸脱などの弱点を見つける方法です。問題を発見する活動であり、安全性を完全に証明するテストではありません。発見後の修正と再評価まで含めて運用します。
詳しい説明
それが何か、何ができるか、どこで使われるか
AI Red Teamingは、AIモデルやAIシステムに対して攻撃者の視点から意図的に失敗や悪用を試み、脆弱性、危険な出力、情報漏えい、権限逸脱、バイアス、プロンプトインジェクションなどを発見する評価方法です。NISTは、AIエージェントの大規模なレッドチーム競技を通じて、外部データに含まれる指示によるエージェント乗っ取りなどを調査しています。対象はモデル単体に限らず、プロンプト、検索、ツール、認証、データ、UI、ログ、実行環境を含むシステム全体になり得ます。テストケースは、既知の攻撃、利用者が想定する誤用、未知の入力、複数ステップの連鎖などを組み合わせ、成功条件と影響を記録します。Red Teamingを一度実施したから安全と証明されるわけではなく、攻撃手法、モデル、データ、権限が変わるたびに再評価が必要です。発見した問題を修正し、再発しないかEvalsや監視で確認する工程とセットで扱います。
通常の成功例だけでなく、悪用、脱獄、情報漏えい、偏りなどの失敗経路を見つけて改善につなげられます。
現在はモデル単体だけでなく、プロンプト、検索、ツール、権限、運用手順を含むシステム全体を対象にします。
関連する用語
この言葉を位置づけるための関連語
根拠資料と確認状況
確認日・出典
読み方と意味を、
分けて確認。
正式名称、意味、使われる分野を分けて記録しています。