Understand How AI Systems Can Be Attacked, and Defend Them
2026/08/21 InfoSecurity — 人工知能 (AI) と大規模言語モデル (LLM) のエンタープライズ環境への急速な統合は、イノベーションを急速に促進する一方で、サイバーセキュリティを無法地帯ともいえる状況にしている。例として挙げられるのが OpenClaw である。この AI システムは、過剰な権限を持つエージェントによるユーザー・ファイルの自律的な削除から、シャドー AI の無秩序な拡大に至るまで、さまざまな懸念を引き起こし、セキュリティ専門家を警戒させている。

予防は治療に勝るという格言は有効だが、こうした状況において、セキュリティ・チームは予防策の遅れに直面している。
その一方で、シンガポール以外の複数の東南アジア諸国において、重要インフラを規制するサイバーセキュリティ法案が導入され、攻撃者によるシステム侵害の手法をモデル化することが義務付けられたのは 2024 年になってからである。この手法は脅威モデリングと呼ばれる。
経営幹部のための脅威モデリング
脅威モデリングの中核となるのは、Threat Modeling Manifesto にまとめられた以下の 4 つの基本的な問いである。
- 私たちは何に取り組んでいるのか?
- 何が問題になり得るのか?
- それに対して何をするのか?
- 十分な対策を講じたのか?
しかし、AI はこの 4 つの問いに新たな課題をもたらしており、脅威モデリングの実践方法そのものを再考する必要性が生じている。その一方で、最も広く利用されている脅威モデリング手法の 1 つが STRIDE であり、Loren Kohnfelder と Praerit Garg が 1999 年に考案し、2004 年に Microsoft が書籍を通じて普及させた。
脅威モデリングは、ソフトウェア開発における重要かつプロアクティブなサイバーセキュリティ活動である。しかし、AI システムの普及に伴い、重要な疑問が生じる。従来の脅威モデリング手法だけで、AI 固有の脅威をプロアクティブに特定するには十分なのか?
包括的な概念
この問いに答える前に、AI という用語が包括的な概念を示すことを理解する必要がある。AI は 1956年のダートマス・サマー・リサーチ・プロジェクトで誕生し、過剰な期待と進歩が停滞する「冬の時代」を行き来してきた。機械学習 (ML)/コンピューター・ビジョン/自然言語処理 (NLP) などのサブフィールドが実用的な成果を上げ始めたのは、1990年代から 2000年代になってからであり、やがて敵対的生成ネットワーク (GAN) など ML のアイデアと NLP の進歩が組み合わされ、生成 AI が登場した。
その後、一般ユーザーが AI にアクセスするための自然言語による直接的なインターフェースを提供したのが LLM であり、これにより過去 3 年の間に AI の人気は爆発的に高まった。その一方で、生成 AI はオープンエンドかつ非決定論的な自然言語入力を特徴とするため、その普及により従来の脅威モデリング手法を適用することが難しくなっている。
脅威モデリングの実践はどのように進化したか
STRIDE などの従来モデルは、ソフトウェアが決定論的であり、攻撃の結果としてサイバーセキュリティ特性が失われるという前提で構築されている。しかし、生成 AI では、この前提に対して 2 つの新たな問題が生じる。
- 生成 AI システムは確率的であり、独立した試行では結果を再現できないため、セキュリティ特性の評価も確率的なものになり得る。
- 自然言語入力ではデータと情報の区別が難しくなるうえ、変化し得るコンテキスト・ウィンドウによって、技術的な解決策に対する人的要因の介入という、さらなる複雑性が持ち込まれる。
これを示す一例が Grandma attack であり、攻撃者は “grandma persona” を通じてチャットボットを操作し、情報の引き出し/有害な応答の生成/悪意のあるコードの作成を行わせる。こうした攻撃は、プロンプト・インジェクションと呼ばれる手法により実行されるが、従来の決定論的なソフトウェアでも、厳格な構文上の欠陥を悪用する SQL インジェクションという攻撃が存在する。その一方で、プロンプト・インジェクションが悪用するのは LLM 本来の機能であり、ここに問題の本質がある。
セキュリティより機能性を優先するという意識的なトレードオフの結果がプロンプト・インジェクションであるため、完全な緩和は困難と考えられる。したがって、AI に提供できるのは統計的なセキュリティ保証にとどまり、それすら大きな不確実性を伴うため、SQL インジェクション脆弱性に対するパラメータ化クエリの使用といった、従来のセキュリティ脆弱性に対処してきた決定論的な助言とは異なるものとなる。
脅威モデリングの観点でも、AI システムやモデル化への理解に加えて、限られたサイバーセキュリティ予算を投入すべき領域の把握には、新たなフレームワークが必要になる。
新たな脅威モデリング・フレームワーク
サイバーセキュリティは、常にイノベーションを追いかける立場にあるが、その対応速度は大幅に速まっており、AI システム固有の脅威分類体系として MITRE ATLAS (Adversarial Threat Landscape for AI Systems) が導入されている。これは、攻撃者による AI システムへの攻撃手法を示すものであり (Threat Modeling Manifesto の Q2)、また、OWASP の大規模言語モデル向け/機械学習向け Top 10 などのフレームワークも存在するが、分類体系だけでは不十分である。
複雑なエンタープライズ・アーキテクチャ全体に ATLAS を効果的に適用するために、MAESTRO などのフレームワークを採用する組織が増え始めている。MAESTRO が効果的とされるのは、AI システムに対する理解の体系化 (Threat Modeling Manifesto の Q1)/エージェント型 AI の異なる抽象化層の対応付け/対象となる AI システムがもたらすリスク状況の把握を可能にするためである。
MITRE ATT&CK に対する補完的なフレームワーク MITRE D3FEND が存在するのと同様に、セキュリティ・リサーチャーは AIDEFEND と呼ばれるフレームワークを考案した。AIDEFEND は、前述した攻撃者ベースの脅威モデリング・フレームワークで特定された脅威への緩和策を集約したものである (Threat Modeling Manifesto の Q3)。
最後になるが、AI システムのセキュリティは、一度実施すれば完了するチェック項目のようなものではなく、AI システムの導入ライフサイクル全体と並行して継続するものである。そのため、本番環境の AI システムに存在するリスクの度合いを継続的に検討する必要がある。その先に、最後の問いである「Q4:十分な対策を講じたのか?」がある。
ここで重要となるのが、National Institute of Standards and Technology (NIST) の AI リスク・マネジメント・フレームワーク (AI RMF) であり、これは、ガバナンスと 3 つの重要な柱である map/measure/manage を中心とする RMF 構築の基盤を定めている。RMF はセキュリティにとどまらず、プライバシー/安全性/公平性/説明可能性などの AI ガバナンスにおける他の側面も対象としている。プロンプト・インジェクションやモデル・インバージョンなどの攻撃手法により、安全性が損なわれる可能性があるため、こうした特性も重要である。
以下の表は、脅威モデリング・プログラムを構築する出発点となるフレームワークを、4 段階のアプローチとして概要レベルで整理したものである。
| Manifesto Question | The AI Security Challenge | Possible Frameworks | Purpose |
|---|---|---|---|
| 1. What are we working on? | AI is a “black box” with complex, non-deterministic workflows and agentic layers. | MAESTRO | Decomposes the AI system into distinct layers of abstraction (infrastructure, models, agents, plugins) to map the attack surface. |
| 2. What can go wrong | Attackers use natural language (Prompt Injection, Data Poisoning) instead of traditional code exploits. | MITRE ATLAS / OWASP Top 10 (for GenAI/LLMs/ML) | Provides a comprehensive taxonomy of AI-specific adversary tactics, techniques, and vulnerabilities. |
| 3. What are we going to do about it? | Identifying a threat in theory does not stop an attack in runtime production. | AIDEFEND | Operationalizes security by providing the active mitigations (semantic filtering, rate limiting, agent monitoring) needed to block attacks. |
| 4. Did we do a good enough job? | AI risk is continuous and involves complex human, privacy, and explainability factors. | NIST AI RMF | Provides the governance rubric to continuously measure, map, and manage AI risks (privacy, security, fairness) across the lifecycle. |
行動喚起:AI システムの脅威モデリングを体系化する
AI の急速な導入により、セキュリティ・チームは決定論的なソフトウェア向けに設計された従来の手法だけに依存できなくなっている。しかし、セキュリティ・コミュニティは MAESTRO/MITRE ATLAS/AIDEFEND/NIST AI RMF など、さまざまなフレームワークを通じて対応を進めている。
これらを脅威モデリング宣言の文脈に位置付けることで、セキュリティ目標を損なうことなくイノベーションを実現する AI システムを組み込んだ、堅牢なエンドツーエンドのセキュリティ・プログラムを構築できる。言い換えれば、猛烈な勢いで進む AI イノベーションのペースに追いつくうえで、セキュリティ・コミュニティは決して無力ではない。
エンタープライズ AI 環境で採用が進む OpenClaw などにより、非決定論的な動作やプロンプト・インジェクションなどによる意図しないデータ漏洩/制御奪取/不正実行のリスクが深刻化しています。従来の決定論的アプローチの限界/予測不能な確率的挙動/コンテキスト・ウィンドウの悪用といった問題が生じる中、技術開発の進展に応じた防御手法の確立が急務となっています。これに対し、MITRE ATLAS や MAESTRO による多層的構造の視覚化/AIDEFEND を用いた段階的対策の集約/NIST AI RMF に基づく継続的リスク管理モデルの導入による確実な統制管理が求められます。
You must be logged in to post a comment.