本文へ移動
  1. トップ
  2. 用語集
  3. レッドチーミング(AI の弱点をわざと探す確認)
用語集

レッドチーミング(AI の弱点をわざと探す確認)とは

要点よみ: れっどちーみんぐ

AI を使った仕組みを攻撃する側の目でわざと崩しにいき、間違いや情報漏れにつながる弱点を探す確認。

レッドチーミングは、AI を使った仕組みの答えをわざと疑い、崩しにいくことで弱点を探す確認です。日本の AI セーフティ・インスティテュート(AISI)は、攻撃者の目で AI の仕組みを攻め、対策が効いているかを確かめる評価の方法と説明しています。AISI は 2024 年 9 月に手法のガイドを公開しました。2025 年 3 月の改訂版には、社内の資料を探して答える仕組み(RAG)で実際に行った手順が載っています。

探す弱点は、もっともらしい間違いや、答えに出てはいけない情報が出ることです。読ませた文書に紛れ込ませた命令で動きを乗っ取られること(プロンプトインジェクション)や、裏で与えている指示を聞き出されることも確かめます。ガイドは、公開や運用を始める前に行うことを基本とし、運用を始めた後も必要に応じて繰り返すのが望ましいとしています。

見つけたことは、どの質問でどう間違えたかを記録に残します。記録があれば、直す順番を決められ、直した後に同じ質問で確かめ直せます。ガイドも、結果を報告書にまとめ、改善の計画を立て、直した後を確かめるところまでを手順にしています。崩しにいく観点は、AI 以外の確かめにも使えます。当社が業務のアプリの試作を AI に評価させたときは、観点に「サボれるところ」を入れました。その結果、一言だけでも保存できる抜け道が見つかりました(試作を AI の役で確かめた記事)。