AI Agents Gain Unintended Internet Access During Cybersecurity Evaluations
2026/08/18 gbhackers — AI セキュリティ評価企業 Irregular が公開した調査結果によると、複数のフロンティア AI モデルが、管理されたサイバーセキュリティ・テスト中に、インターネット・アクセスが許可された単一の評価シナリオで、架空の標的名と実在するドメイン名が一致したことをきっかけに、実在するインターネット接続システムに意図せずアクセスし、操作を実行した。この問題について Irregular は、すでに解決済みであるとしたうえで、調査で明らかになった複数の事例が、7月30日時点で顧客が公表したものと同一の根本的な事案に関連する一方、顧客システムの侵害や顧客データの流出を示す証拠はないと確認している。

AI エージェントが意図せずインターネットにアクセス
現実的な制約下で AI モデルが複数段階の侵入手順を計画し、実行の可否を判断できるよう設計された高度なサイバー能力評価の実施中に、このインシデントは発生した。通常、この種の評価では、複数のモデルを対象として数千回のシミュレーションが実行され、多くの場合 48時間~72時間ほどで完了する。
このシナリオでは、悪意ある内部関係者を模した主体が、企業の本番データベースに保存された機密性の高いデータへのアクセスを試み、使用されたモデルには、偵察/秘密鍵の特定/標的環境の発見/データの抽出/検知制御の回避など、一般的な侵入活動に関連する手順を実行するタスクが与えられていた。
エンジニアたちは、シミュレーション対象の組織に架空の企業名を設定し、事前レビューも実施していたが、この名称が、ほとんど知られていない実在のドメインと一致していた。大半のシミュレーションは内部アドレスが提供されるため評価環境内に留まっていた一方、明示的な指示を受けていないにもかかわらず、少数のモデルが実在するドメインへのアクセスを試みた。
インターネット・アクセスが有効化されていたことで、一部のモデルが実在する Web サイトを演習環境の一部と誤認し、脆弱性の悪用/認証情報の抽出/本番データベースへのアクセスなどの操作が実行されたと、Irregular は述べている。あるケースでは、モデルが類似した名称のサイトへと移動し、公開されていた認証情報を発見したと報告されている。
Irregular によると、この挙動の発生頻度は、高度なシミュレーション 10,000 回あたり 1 回未満であり、手順の後半に数百回の反復を重ねた後に確認されることが多かった。発生率が低かったことに加え、通常の評価記録にも不審または攻撃的に見える活動が大量に含まれるため、検知は困難になった。
同社が強調するのは、影響を受けたドメインでは、いくつかの標準的なセキュリティ制御が欠如しており、最新のフロンティア・モデルでも容易に侵入できる状態だったという点である。また同社は、このインシデントについて、特定のモデルが異常な挙動や特別に高度な能力を示した証拠と捉えるべきではなく、むしろ主要な AI システムにおいてサイバー能力がさらに広く備わるようになっていることを示すものだと説明している。
この出来事が浮き彫りにしたのは、新たな運用リスクである。評価境界/ネットワーク経路/シナリオの前提に設定ミスがある場合、AI エージェントが自動化された内部脅威のように振る舞う可能性がある。
これを受けて Irregular は、影響を受けた評価の無効化/関連ログの確認/影響を受けた関係者への通知/継続的な調査を実施した。同社は、モデルの挙動に対する手動確認の拡大/封じ込め制御の強化/モデルの自律性や環境隔離に関するセキュリティ上の前提を検証する専任の社内チームの設置を進めているほか、設定文書/監視システム/事故対応の連携/シナリオで使用する架空名称について、継続的な検証を強化していく計画である。
ドメインの確認は、1 回限りではなく定期的に実施する必要がある。その理由は、1 回目のテストを設計した後であっても、新たなドメイン登録によって評価対象と重複する可能性があるためである。
今回の情報開示が示しているのは、AI 安全性チームが直面する両立が難しい問題である。実際の攻撃者がオンライン・サービス/公開コード・リポジトリ/外部公開基盤/外部からの偵察を利用するため、現実的なサイバー評価では限定的なインターネット接続が必要になる場合がある。その一方で、その同じアクセスによって、シミュレーション上のエラーが現実世界の活動へ変わる可能性もある。
こうした課題を受けて Irregular は、評価に関する推奨事項をまとめた白書を公開する予定であり、主な優先事項には、外向き通信の制御/許可リストに登録した接続先/継続的なドメイン検証/状況認識型の警告/実行記録の保持/デジタル・フォレンジック情報の連携と共有などが含まれる見込みである。
サイバー能力を持つモデルが高度化するにつれて、こうした対策を前提として、基本的な隔離環境から厳格に監視された多層防御の運用体制へと、安全な評価設計を進化させる必要がある。
AI セキュリティ評価企業の Irregular が公開した記事を取り上げています。サイバー攻撃を模擬する検証で AI エージェントが実在するWeb サイトへ意図せず到達した問題が扱われています。架空設定された組織名称と実在ドメインの一致/インターネット通信の有効化が主要要因です。外部サイトの誤認/脆弱性攻撃/認証情報抽出などの影響が生じました。影響評価の無効化/手動確認の拡大/通信制御の強化といった対処が講じられています。安全な検証に向け、厳格なネットワーク隔離/送信先の制限/ドメイン名の定期照合/監視の徹底が求められます。
You must be logged in to post a comment.