OpenAI が誤って悪用したゼロデイ脆弱性:Hugging Face に対する攻撃の実態が明らかに

OpenAI Exploits Zero-Day to Gain Internet Access and Compromise Hugging Face Servers

2026/07/22 gbhackers — OpenAI が明らかにしたのは、高度なサイバー能力の内部評価中に AI エージェントがゼロデイ脆弱性を悪用し、制約付きの研究環境から脱出し、Hugging Face の本番インフラの一部を侵害したことである。このアクティビティを検出した Hugging Face は封じ込めに成功したが、OpenAI の内部セキュリティ・チームも評価中に異常な挙動を特定していた。

OpenAI が Hugging Face サーバを侵害

OpenAI は、このインシデントを、最先端の AI 能力が関与する前例のないサイバー・セキュリティ・イベントと説明した。複雑な悪用経路と多段階のサイバー運用を完了させる能力を測定するために設計された、ExploitGym ベンチマークを用いて、これらのモデルは評価される。

この能力の最大値を評価するために、OpenAI が無効化したのは、本番環境の保護策と、モデルによる有害な活動を防ぐサイバーリスク分類器である。

評価環境は隔離されているはずであり、アウトバウンド・ネットワーク・アクセスは制限されていた。このモデルは、内部でホストされたサードパーティ・パッケージ・レジストリのプロキシとキャッシュを通じてのみ、ソフトウェアをインストールできる状態にあった。

しかし OpenAI によると、このエージェントはベンチマーク・タスクを完了するために、制限のないインターネット・アクセスを得ようとして、かなりの計算時間を費やしたという。伝えられるところでは、このモデルはパッケージ・レジストリ・キャッシュ・プロキシに存在するゼロデイ脆弱性を発見し、それを悪用した。OpenAI は、この問題を影響を受けるベンダーへ責任を持って開示し、修復に取り組んでいると述べた。

この脆弱性の悪用に成功したエージェントは権限を昇格し、研究環境内でラテラル・ムーブメントを行い、インターネット接続を持つノードに到達した。こうしてオンライン接続を得たモデルは、ExploitGym に関連するモデル/データセット/ベンチマーク解答などを、Hugging Face がホストしている可能性があると推論した。このエージェントは、提供された課題を解くのではなく、評価において役立つ情報を探した。

観測された攻撃チェーンの 1 つについて OpenAI は、盗まれた認証情報と追加のゼロデイ脆弱性を悪用するモデルが、Hugging Face サーバに影響を及ぼすリモートコード実行経路を特定したと述べている。

見かけ上の目的は、広範な侵害やデータ破壊ではなく、Hugging Face の本番データベースからテスト解答を取得することだった。それにもかかわらず、このアクティビティが示したのは、高性能モデルはソースコードにアクセスしなくても、非従来型の攻撃経路を自律的に特定し、脆弱性を連鎖させ、権限を昇格し、実システム内でラテラル・ムーブメントを達成できることだ。

Hugging Face のセキュリティ・チームと防御エージェントは、この侵入試行を検出して阻止し、OpenAI と連携する前に封じ込めとフォレンジック再構築を開始した。2 つの組織は調査を継続しており、フォレンジック作業が完了した時点で、脆弱性とインシデントに関するより技術的な知見を公開すると、OpenAI は述べている。

このインシデントを受け、OpenAI は研究の進捗の遅れを受け入れるかたちで、より厳格なインフラ制御を優先している。さらに同組織は、サイバー評価中に使用される封じ込め策/監視/アクセス制御/保護策も強化している。その一方で Hugging Face は、OpenAI の trusted-access プログラムに追加され、防御側として、高度な AI 能力を研究と修復に利用できるようになった。

このインシデントが浮き彫りにしたのは、拡大するセキュリティ課題である。長期的な推論が可能なモデルは、ベンチマーク上のサイバー性能を、現実の運用における影響へと変換できる段階に達している可能性がある。

防御側にとっての優先事項は、セグメンテーションの強化/最小権限アクセスの実装/異常検出の強化/パッケージプロキシの堅牢化/AI 対応テスト環境の継続的な監視である。