DeepSeek, Alibaba and Chinese AI Firms Extract Billions of Tokens From U.S. AI Models
2026/09/09 gbhackers — DeepSeek/Alibaba/Moonshot AI/MiniMax/StepFun/Z.AI など、中国を拠点とする AI 企業 6 社が、産業規模の知識蒸留を通じて米国の主要 AI システムから数十億トークンを抽出したと、米国政府機関が指摘している。米国政府機関である National Security Agency (NSA)/Cybersecurity and Infrastructure Security Agency (CISA)/Federal Bureau of Investigation (FBI) が共同で発行した Cybersecurity Advisory「AA26-251A」によると、これらの活動は遅くとも 2024年後半から続いており、中国政府が認識した上で行われていた可能性が高いという。

最先端モデルの応答を合成トレーニングデータへ変換し、競争力のある中国国内モデルの開発に費やされるコストと時間を削減するための組織的な取り組みだと、米国の各機関は捉えている。
知識蒸留とは、より小規模な生徒モデルが、より高性能な教師モデルの出力から学習するための、正当な機械学習 (Machine Learning) の手法である。ただし、米国のアドバイザリにおいては、独自機能の再構築を目的とした大量かつ検知回避を意図する行動と、認可された研究におけるクエリの実行が明確に区別されている。
各機関によると、名前を挙げられた企業群は、米国のモデルを単にベンチマークとして利用したり、通常の製品開発に使用したりしているわけではない。具体的には、Chain-of-Thought 型の推論/強化学習の最適化/ソフトウェア・エンジニアリング/自律型ワークフロー/法律関連のタスク/質問応答/文書生成などの、狙いを定めた領域の出力を収集するために、数百万回に及ぶ組織的なやり取りを実行したとされる。
その目的は、モデルの重みを直接コピーすることではなく、最先端システムにおける推論/応答/ツール使用/品質の評価方法を、中国国内のモデルに学習させることにあった。
このような能力の抽出は、知的財産/国家安全保障の双方に関わる問題であると、米国政府機関は警告している。モデルの出力を大規模に収集すれば、競合企業は開発費用の負担を軽減するだけではなく、長年にわたる先端研究/計算資源への投資/評価作業/安全性エンジニアリングの成果を取り込める可能性がある。
DeepSeek は 2024年後半から、米国の最先端モデルを対象とした組織的な知識蒸留を実施し、R1/V3 モデルファミリーのトレーニングに使用するデータの収集を重点的に行っていたとされる。米国のアドバイザリは、推論能力/ドメイン固有の機能/特定用途向けの最適化のために、Claude/GPT/Gemini/Grok の複数モデルを、DeepSeek が標的にしていたと指摘している。広く引用されている DeepSeek のトレーニングコスト「560 万ドル」には、知識蒸留から取得したとされるデータの価値が含まれていないとしている。
CISA のアドバイザリによると、この活動では Claude/GPT/Gemini/Grok の各モデルにおける、独自の推論/コーディング/エージェント型/特定用途向けの能力が標的とされていたという。
米国の AI モデルが標的に
Alibaba も、Qwen モデルファミリーの性能向上を目的として産業規模の知識蒸留を使用したと、このアドバイザリは指摘している。ソフトウェア・エンジニアリング機能/カスタマー・サービスの対話/仮想キャラクター生成/教師ありファインチューニング (Fine-Tuning)/強化学習を含むトレーニング・プロセスの改善を目的として、Claude/GPT システムからデータを取得したとされる。
Kimi モデルの開発元である Moonshot AI は、コーディング/数学/強化学習/エージェント型能力の開発に使用するデータを抽出したとされ、MiniMax は Chain-of-Thought 型の推論/コード開発を狙っていたと報告されている。一方、StepFun/Z.AI は、より新しい世代の米国製モデルが備える高度なコーディング能力/推論能力を標的としていたとされる。
これらの活動では、地理的な利用制限の回避/顧客の身元の隠蔽/プロバイダーのセキュリティ対策の回避を目的として、「transfer stations」と呼ばれるグレーマーケットの API プロキシサービスが使用されたと、各機関は指摘している。一連のリクエストは、ネイティブ API/クラウド・サービス/第三者アグリゲーター/アカウントプール/中継インフラを経由して送信されていたという。
このほかに、身元を隠すためのアカウント/開発者間で共有するためのプレミアム・サブスクリプションの一括購入/ブロックされた場合の代替アクセス経路への自動切り替え/メタデータの無害化/複数プロバイダーにリクエストを分散する集中管理システムなども使用されている。このようなインフラが用いられると、個々のアカウント/IP アドレス/プラットフォームのいずれか 1 つを確認しても、活動全体を把握できるとは限らないため、検出が困難になる。
このアドバイザリでは、AI 推論 API へのアクセス/プロンプト・インジェクション/ジェイルブレイク/モデル出力の収集/推論インターフェイスを介したモデル出力の抽出など、複数の手法を MITRE ATLAS にマッピングしている。特に懸念されているのは、モデルの非公開の Chain-of-Thought 型推論を開示させようとする試みである。これにより、複雑なコーディング/論理的推論/エージェント型タスクを解決する手法が明らかになる可能性がある。
NSA/CISA/FBI が AI プロバイダーに求めるのは、異常なプロンプト/アカウントの挙動/ネットワーク活動/大規模なスループットパターンの監視である。その兆候には、新規作成されたアカウントによるクォータの上限までの消費/さまざまな IP アドレスからの複数ユーザーによるサブスクリプション共有/24 時間 365 日にわたり継続するアクティビティ/極めて反復性の高いクエリの送信/サブスクリプション数と使用量の異常な比率といった挙動が含まれる。
さらに各機関は、正規ユーザーへの影響を避けながら、抽出が疑われるアクティビティに対して出力を慎重に変更し、敵対者に収集されるデータの価値を低下させることを推奨している。複数のアクセス・チャネルに分散したキャンペーンを明らかにするため、モデルベンダー/クラウド・プロバイダー/API アグリゲーター/政府機関の間でインテリジェンスを共有することを、最も重要な対策として求めている。
今回のアドバイザリが示しているのは、セキュリティ分野においてモデル出力の窃取が独立した脅威として認識されつつあり、モデルの重みを保護するだけでは不十分になっている状況である。最先端 AI の開発者には、推論レイヤー/行動データ/モデル固有の能力を、インターネット規模で行われる組織的な抽出から防御することが求められる。
この記事では、中国の AI 企業 6 社による米国の最先端 AI からの数十億 Token に及ぶ産業規模の知識蒸留が紹介されています。背景として、中国の AI 企業が米国の主要モデルの応答を合成 Training Data へ変換し、自国モデルの開発コストと時間を削減する動きが存在しています。影響として、知的財産や国家安全保障に関わるリスクが生じており、モデルの推論や応答の仕組みが大量に抽出される事態となっています。対応策として、AI Inference API における異常な挙動の監視/不審なプロキシサービスの遮断/インテリジェンスの共有が求められます。
You must be logged in to post a comment.