Claude Opus 5 Most Resistant to Indirect Prompt Injection Attacks, With Just 2% Success Rate
2026/08/10 gbhackers — Anthropic の Claude Opus 5 は、間接的プロンプト・インジェクション (IPI) 攻撃の攻撃成功率を大幅に低減させ、Gray Swan の IPI ベンチマークにおける 15 回の試行で、成功率を 2% まで引き下げている。この数値は、Claude Opus 4.8 で観測された 5.5% の成功率からの改善を示しており、同社が新たに公開したシステム・カードによると、現時点の Opus 5 は、このカテゴリで評価されたモデルの中で最も堅牢なモデルとなる。

Claude Opus 5 が間接的プロンプト・インジェクションに耐性
間接的プロンプト・インジェクションが重大なリスクをもたらすのは、信頼できないコンテンツを処理し、ツール/エンタープライズ・データ/ブラウザ/ユーザー・アカウントへのアクセス権を維持している AI エージェントである。
明示的な指示を必要とする直接的なジェイルブレイクとは異なり、間接的な攻撃において必要とされるのは、エージェントがアクセスし得るメール/ドキュメント/Web ページ/ツールなどのレスポンスに埋め込まれた悪意のある指示である。この攻撃が成功するのは、この種の信頼できない指示を、モデルが正当なユーザー・リクエストとして解釈した場合である。

Anthropic が警告しているのは、モデルが機密データにアクセスしてアクションを実行できる場合に、このリスクが増大する点である。侵害されたエージェントが操作できるものには、内部通信の流出/データの削除/システムの侵害/金融取引などがある。
公開ページまたは共有ドキュメントに、単一の悪意のペイロードを配置する攻撃者は、一度に一人の被害者を侵害するのではなく、同時に複数のエージェントを標的にする可能性がある。
Gray Swan ベンチマークの結果
この IPI ベンチマークは、Anthropic が以前に用いていた Agent Red Teaming ベンチマークに代わるものであり、Claude モデルが飽和状態のパフォーマンスを達成した後、以前のベンチマークは廃止された。この新たな評価は、Gray Swan/UK AI Security Institute/US Center for AI Standards and Innovation などのモデル開発者との協業により開発され、コーディング/ツール使用/GUI ベースの環境をカバーする 28 のシナリオを含む。
| Model | Success probability, 1 attempt | Success probability, 15 attempts |
|---|---|---|
| Claude Opus 5 | 0.2% | 2.0% |
| Claude Opus 4.8 | 0.5% | 5.5% |
| Claude Sonnet 5 | Not stated | 5.9% |
| Claude Mythos 5 | Not stated | 2.6% |
| Muse Spark | Not stated | 16.5% |
| GPT-5.6 Sol | 3.1% | 20.0% |
| GPT-5.5 | Not stated | 20.8% |
| GPT-5.6 Terra | Not stated | 30.4% |
| GPT-5.6 Luna | Not stated | 43.9% |
研究者たちが選定したのは、モデル間での高い転移性で知られる、既知の 1,130 件の攻撃シナリオであり、これらのテストでは、1 回/10 回/15 回の試行において、少なくとも 1 回の攻撃が成功する確率が評価された。Claude Opus 5 が記録したのは、1 回の試行後の成功確率 0.2% と 15 回の試行後の 2.0% であり、これに対し Opus 4.8 が達成したのは、それぞれ 0.5% と 5.5% である。
さらに、Claude Sonnet 5 は 15 回の試行後の成功率が 5.9%、Claude Mythos 5 は 2.6% であり、最も堅牢な非 Claude モデルとされる Muse Spark の成功確率は、15 回の試行で 16.5% であった。

Gray Swan の Shade Red Teaming ツールを用いた適応的プロンプト・インジェクション・テストにおいても、Opus 5 は大幅な改善を示した。コーディング環境において、Opus 5 の試行レベルでの攻撃成功率は、拡張思考モデルありの場合に 0.56%、なしの場合に 0.41% であり、これに対し Opus 4.8 は、それぞれ 7.03% と 17.44% であった。また、プロンプト・インジェクション用のプローブを有効化することで、Opus 5 の両方の設定ともに 0.18% まで低下した。
GUI ベースのコンピュータ使用テストにおいて、Opus 5 は攻撃成功率を、拡張思考モデルありで 7.14% から 0.54% へ、なしで 6.21% から 0.39% へと低減させた。いずれも Opus 4.8 との比較である。
Anthropic のブラウザ使用の評価において、Opus 5 の生の攻撃成功率は拡張思考モデルありで 3.70% であったが、同社の自動モードのセーフガードを有効化した場合には、129 のシナリオにわたって成功した攻撃はゼロであった。
これらの結果が示すのは、意味のある強化ではあるものの、免疫にはなっていないという点であり、実際の敵対者は戦略を継続的に適応させるため、静的なベンチマークでは耐性を過大評価され得ると、Anthropic は指摘している。
AI エージェントを利用する組織に対して明確にされたのは、モデルの堅牢性を高めるためには、最小権限の許可/重要なアクションに対する人間による確認/信頼できないコンテンツの分離/監査ログと異常なデータ・アクセスのモニタリングが必要であるという実践的な教訓である。今回の 2% というベンチマークの成功率は大幅な改善を意味するが、高ボリュームのエンタープライズ・ワークフローにおいては、低確率の侵害経路に対しても多層的な統制が必要となる。
Claude Opus 5 や Claude Sonnet 5 といった製品において、防御性能の向上が確認されています。AI がメールや Web ページなどの外部情報を読み込む際に、悪意の命令をユーザーの指示と誤認する危険性があります。これにより機密情報の不審な送信やデータの不当な消失につながる恐れが存在します。対策として推奨されるのは、アクセス制限の設定/人間による承認プロセスの組み込み/データの隔離/監視体制の構築などの多層的な防御策の導入です。
You must be logged in to post a comment.