Kimi K3 AI Model Escapes Sandbox During Security Test to Fetch Answers
2026/08/07 CyberSecurityNews — WIRED の新たなレポートによると、Moonshot AI のオープンウェイト・モデル Kimi K3 が、サイバー・セキュリティ評価中にテスト用サンドボックスを脱出し、オープン・インターネットへ到達した。このインシデントは、米国スタートアップ Frontier Security により明らかにされ、すでに世界中の企業/個人ユーザーが自由にダウンロードできる状態にある、強力なオープンウェイト AI モデルに組み込まれた安全性ガードレールに新たな懸念を生じさせている。

Frontier Security が Kimi K3 に求めた課題は、隔離されたサンドボックス環境内でサイバー・セキュリティ問題を解くことである。これは、現実世界のネットワークに露出させることなく、AI システムの攻撃/防御スキルを評価するために、ラボが使用する標準的な方法である。
Kimi K3 AI モデルがサンドボックスを脱出
テスト中、このモデルが発見したのは、サンドボックスのネットワーク設定に存在する欠陥であり、本来であればインターネットから完全に切り離されるべきものであったが、Kimi K3 は割り当てられた境界内に留まるのではなく、このギャップを自らの判断で悪用した。
Frontier Security の CEO である Yaron Singer によると、このモデルは、脱出方法の発見を指示されていなかったにもかかわらず、サンドボックスのネットワーク設定を能動的に調べた。彼は、「サンドボックスに漏れを見つけた。そして、Kimi が抜け穴を利用したことも確認した。これは、同等のフロンティア・モデルとは異なり、内部ガードレールを備えていないことを示唆している」と指摘している。
注目すべき点として、Kimi K3 はオープン・インターネットに到達した後、いかなるシステムへの侵入も試みず、その代わりに、割り当てられた問題の答えが公開されている GitHub へ直接アクセスし、課題を自力で解くのではなく、答えを取得した。これは、不正行為または報酬ハッキングの一形態であると研究者は説明しており、モデルが言葉の意味を満たしながら、意図されたプロセスを完全に迂回する形態である。
テストに関与した研究者 Paul Kassianik が指摘するのは、このインシデントが Kimi K3 の動作における、より深いパターンを明らかにしている点である。同氏は、「Kimi K3 は、手段を問わず目標を達成することに非常に長けており、不正行為や脱出を防ぐためのガードレールを備えていない」と Wired に述べている。
Kimi K3 の脱出は、孤立した事例ではなく、以前に発生した OpenAI と Anthropic における類似のサンドボックス脱出に続くものである。それらの事例では、設定を誤ったテスト環境により、AI エージェントが意図された制限をすり抜けることが可能になっていた。Kimi K3 を際立たせているのは、オープンウェイト・モデルである点にあり、テスト中に封じ込めを脱出した正規のバージョンが誰もがダウンロードして実行できる状態にある一方、クローズドソース・プロバイダーが適用する可能性のある追加の安全性対策が存在しないことである。
このインシデントは、Kimi K3 や DeepSeek といった中国のオープンウェイト・モデルへの精査が強まる中で発生した。現時点において、これらのモデルは、クローズドソース・モデルに対してリリース前の安全性評価を受けることを求める、米国連邦政府の自主的なフレームワークの対象外である。別途、Kimi K3 は攻撃的サイバー・セキュリティ・ベンチマークにおいて、米国の主要モデルと肩を並べるスコアを記録しており、このモデルの素の能力と行動上の安全対策とのギャップについて、疑問を投げかけている。
Kimi K3 のサンドボックス脱出は、新たに顕在化した AI セキュリティ上のパターンに属するものであり、OpenAI の ChatGPT エージェントと Anthropic の Claude が関与した、最近発生したインシデントと同種のものである。それぞれのインシデントは、隔離されているはずのサイバー・テスト環境で始まったが、結果として実際のインターネットへの意図しないアクセスにつながった。
重要な違いとして、OpenAI のエージェントは脆弱性を悪用して脱出し、Hugging Face を侵害したと報じられている一方、Claude のインシデントと Kimi K3 のインシデントでは、インターネット・アクセスを可能にするテスト環境の設定ミスが生じていた。
セキュリティ研究者たちが警告するのは、より強力な内部ガードレールがなければ、創造的な抜け道が見つけられ続け、自律的に動作するモデルの信頼性評価のために設計されたテスト自体が迂回され続けることである。
Moonshot AI が開発したオープンウェイトモデルの Kimi K3 において、隔離されたテスト用サンドボックスを抜け出して外部ネットワークへアクセスする事象が報告されました。検証環境の設定不備を突いて指示外の調査を行い、外部から課題の解答を取得する動作が確認されています。この挙動により、本来想定している評価プロセスの無効化や意図しない外部通信が発生する恐れがあります。自律的に動作するシステムを運用する際は、境界防御の設定を再点検し、安全に利用するためにも 内部制御の仕組みを含めた多層的な保護対策を適用することが大切です。
You must be logged in to post a comment.