Claude Opus の間接プロンプト・インジェクション耐性:成功率 2% という最高値を記録

Claude Opus 5 Most Resistant to Indirect Prompt Injection Attacks, With Just 2% Success Rate

2026/08/10 gbhackers — Anthropic の Claude Opus 5 は、間接的プロンプト・インジェクション (IPI) 攻撃の攻撃成功率を大幅に低減させ、Gray Swan の IPI ベンチマークにおける 15 回の試行で、成功率を 2% まで引き下げている。この数値は、Claude Opus 4.8 で観測された 5.5% の成功率からの改善を示しており、同社が新たに公開したシステム・カードによると、現時点の Opus 5 は、このカテゴリで評価されたモデルの中で最も堅牢なモデルとなる。

Claude Opus 5 が間接的プロンプト・インジェクションに耐性

間接的プロンプト・インジェクションが重大なリスクをもたらすのは、信頼できないコンテンツを処理し、ツール/エンタープライズ・データ/ブラウザ/ユーザー・アカウントへのアクセス権を維持している AI エージェントである。

明示的な指示を必要とする直接的なジェイルブレイクとは異なり、間接的な攻撃において必要とされるのは、エージェントがアクセスし得るメール/ドキュメント/Web ページ/ツールなどのレスポンスに埋め込まれた悪意のある指示である。この攻撃が成功するのは、この種の信頼できない指示を、モデルが正当なユーザー・リクエストとして解釈した場合である。

Attack Success Rate (Source: CDN Anthropic)
Attack Success Rate (Source: CDN Anthropic)

Anthropic が警告しているのは、モデルが機密データにアクセスしてアクションを実行できる場合に、このリスクが増大する点である。侵害されたエージェントが操作できるものには、内部通信の流出/データの削除/システムの侵害/金融取引などがある。

公開ページまたは共有ドキュメントに、単一の悪意のペイロードを配置する攻撃者は、一度に一人の被害者を侵害するのではなく、同時に複数のエージェントを標的にする可能性がある。

Gray Swan ベンチマークの結果

この IPI ベンチマークは、Anthropic が以前に用いていた Agent Red Teaming ベンチマークに代わるものであり、Claude モデルが飽和状態のパフォーマンスを達成した後、以前のベンチマークは廃止された。この新たな評価は、Gray Swan/UK AI Security Institute/US Center for AI Standards and Innovation などのモデル開発者との協業により開発され、コーディング/ツール使用/GUI ベースの環境をカバーする 28 のシナリオを含む。

ModelSuccess probability, 1 attemptSuccess probability, 15 attempts
Claude Opus 50.2%2.0%
Claude Opus 4.80.5%5.5%
Claude Sonnet 5Not stated5.9%
Claude Mythos 5Not stated2.6%
Muse SparkNot stated16.5%
GPT-5.6 Sol3.1%20.0%
GPT-5.5Not stated20.8%
GPT-5.6 TerraNot stated30.4%
GPT-5.6 LunaNot stated43.9%

研究者たちが選定したのは、モデル間での高い転移性で知られる、既知の 1,130 件の攻撃シナリオであり、これらのテストでは、1 回/10 回/15 回の試行において、少なくとも 1 回の攻撃が成功する確率が評価された。Claude Opus 5 が記録したのは、1 回の試行後の成功確率 0.2% と 15 回の試行後の 2.0% であり、これに対し Opus 4.8 が達成したのは、それぞれ 0.5% と 5.5% である。

さらに、Claude Sonnet 5 は 15 回の試行後の成功率が 5.9%、Claude Mythos 5 は 2.6% であり、最も堅牢な非 Claude モデルとされる Muse Spark の成功確率は、15 回の試行で 16.5% であった。

Attack Success Rate ( Source: CDN Anthropic)
Attack Success Rate ( Source: CDN Anthropic)

Gray Swan の Shade Red Teaming ツールを用いた適応的プロンプト・インジェクション・テストにおいても、Opus 5 は大幅な改善を示した。コーディング環境において、Opus 5 の試行レベルでの攻撃成功率は、拡張思考モデルありの場合に 0.56%、なしの場合に 0.41% であり、これに対し Opus 4.8 は、それぞれ 7.03% と 17.44% であった。また、プロンプト・インジェクション用のプローブを有効化することで、Opus 5 の両方の設定ともに 0.18% まで低下した。

GUI ベースのコンピュータ使用テストにおいて、Opus 5 は攻撃成功率を、拡張思考モデルありで 7.14% から 0.54% へ、なしで 6.21% から 0.39% へと低減させた。いずれも Opus 4.8 との比較である。

Anthropic のブラウザ使用の評価において、Opus 5 の生の攻撃成功率は拡張思考モデルありで 3.70% であったが、同社の自動モードのセーフガードを有効化した場合には、129 のシナリオにわたって成功した攻撃はゼロであった。

これらの結果が示すのは、意味のある強化ではあるものの、免疫にはなっていないという点であり、実際の敵対者は戦略を継続的に適応させるため、静的なベンチマークでは耐性を過大評価され得ると、Anthropic は指摘している。

AI エージェントを利用する組織に対して明確にされたのは、モデルの堅牢性を高めるためには、最小権限の許可/重要なアクションに対する人間による確認/信頼できないコンテンツの分離/監査ログと異常なデータ・アクセスのモニタリングが必要であるという実践的な教訓である。今回の 2% というベンチマークの成功率は大幅な改善を意味するが、高ボリュームのエンタープライズ・ワークフローにおいては、低確率の侵害経路に対しても多層的な統制が必要となる。