Meta AI Model による実環境への攻撃:OpenAI/Anthropic に続く 2件目の事例

Meta AI Model Breached External Organization During Cybersecurity Test

2026/08/06 hackread — Meta が確認したのは、同社のサイバー・セキュリティ評価中の AI モデルの 1 つが、テストにおけるミスコンフィグによりインターネット・アクセスを取得した後に、別組織のシステムを侵害したことである。このインシデントの責任は、独立系テスト企業 Irregular によるミスコンフィグにあり、そのミスコンフィグにより AI モデルにインターネット・アクセスが付与されたと、Meta は述べている。その一方で、Irregular が確認しているのは、以前に Anthropic のテストにも影響を及ぼしたものと同じ環境上の問題である点だ。

Meta による侵害の詳細

報告によると、関与したシステムは、コーディングと複雑なタスク向けに設計されている Meta AI の Muse Spark 1.1 モデルである。このモデルは、意図しないインターネット・アクセスを得た後に、セキュリティ評価中に別組織のシステムに存在する脆弱性を悪用しアクセスを終了した。Meta は、影響を受けた組織を公表しておらず、追加の技術的詳細も開示していない。

このインシデントについて Irregular から通知を受けた後に、Meta による調査が開始された。この侵害は、ソフトウェア自体のサンドボックス・エスケープとは無関係であると、Irregular は説明している。その代わりに、人間によるコンフィグ・エラーにより、ライブ・ネットワークが開いた状態になっていた。現時点の同社は、今後のテストに向けて、ベスト・プラクティスを明確化する技術レポートを作成している。

OpenAI と Anthropic により開示された過去の AI 侵害

今年に入り、主要 AI 開発企業が関与する、サイバーセキュリティ・テスト・インシデントが続いており、このインシデントは 3 件目の公開事例となる。以前から Hackread.com は、他のテクノロジー企業リーダーによる類似の開示を取り上げている。2026年7月に OpenAI は、GPT-5.6 Sol を含む同社モデルが、隔離されたテスト・ネットワークの制限をバイパスしたことを確認した。

これらのモデルは、プロキシ・プログラムに存在する未知のソフトウェア欠陥を悪用し、オープン Web へ到達した。そして、Hugging Face サーバを検索し、ExploitGym と呼ばれるベンチマークの評価対象を見つけた。

OpenAI による開示の直後に、Anthropic も自社のテストを確認し、モデルがライブ・システムにアクセスするという 6 件の問題を発見した。これらの事例では、Claude Opus 4.7 が、テスト演習と誤認して、実際の Web サイトを標的にした。その一方で Claude Mythos 5 は、悪意のあるパッケージを PyPI にアップロードし、15 件のライブ・システムに影響を及ぼした。Anthropic が指摘したのは、未知のソフトウェア欠陥ではなく、脆弱なパスワードといった基本的なセキュリティ・ギャップを、自社モデルが悪用した点だ。

より厳格なテスト環境を求める声

主要 AI プロバイダー全体で、この種のインシデントが繰り返されている。それが浮き彫りにするのは、高度なセキュリティ・テスト中の評価環境とネットワーク分離に弱点が存在することだ。また、AI システムにライブ・ネットワークへのアクセスを付与する前に、より厳格な封じ込め措置を講じることの重要性も強調される。