Google の Gemini 3.8 Flash Cyber:ソフトウェアの脆弱性の発見と実用的なパッチ生成に特化

Google Launches Gemini 3.8 Flash Cyber to Identify and Auto-Patch Security Vulnerabilities

2026/09/02 CyberSecurityNews — Google が発表した最新の推論コーディング・モデル・ファミリー Gemini 3.8 は、ソフトウェアの脆弱性の自律的な発見と実用的なパッチの生成に特化した、Gemini 3.8 Flash Cyber と呼ばれる専用バリアントを提供する。今回のリリースは Gemini 3.7 Flash の登場から 3 週間後のことであり、Google にとって 6 週間で 3 回目となる Flash 系モデルのリリースとなる。2 つの新モデルは、共通の基盤アーキテクチャを採用しているが、それぞれ異なるデプロイ・シナリオ向けにチューニングされている。

Google が Gemini 3.8 Flash Cyber をリリース

汎用モデルの Gemini 3.8 Flash は、長期間にわたるソフトウェア・エンジニアリング/エージェント型ワークロードを対象としており、3.7 Flash から大幅に性能を向上させている一方、入力 100 万トークンあたり $0.75/出力 100 万トークンあたり $3.75 という従来の価格を維持している。

複雑なEnd-to-End のエンジニアリング・タスクを対象とする DeepSWE v1.1 ベンチマークでは、数分の 1 のコストで複数の大規模なフロンティア・モデルを上回ったとされており、HLE-Verified でも 54.9% を記録して、技術/専門の両分野にわたる強力な多段階推論能力を示している。

この性能向上について、Google は、難しい問題へ取り組む際にモデルが追加の推論ステップを実行し、ツールを反復的に呼び出す方式によるものだと説明している。ただし、推論強度を高く設定した場合には、トークン使用量が増加する可能性がある。

Gemini 3.8 Flash DeepSWE v1.1 Evaluation
Gemini 3.8 Flash DeepSWE v1.1 Evaluation (Image Source: Google)

サイバーセキュリティに特化した Gemini 3.8 Flash Cyber は、Google の研究発表で明らかにされた新たな Fairwind プログラムを通じ、審査を通過したセキュリティ・チームのみに提供される。この措置は、悪用可能な脆弱性を発見するようトレーニングされたモデルの機微性を反映したものである。

脆弱性の発見に関する、業界で広く利用されるベンチマーク CyberGym では、前世代の 3.5 Flash Cyber だけでなく、大規模な競合フロンティア・モデルをも上回る性能を示したとされる。さらに Google は、CyberGym の中心である C/C++ 以外の 20 種類のプログラミング言語を対象として社内ベンチマークでモデルをテストしており、その結果、成功率は 70% を超え、従来バージョンから大幅に向上した。

Model VariantPrimary Focus & Target WorkloadsKey Benchmark PerformanceAccess & Deployment Model
Gemini 3.8 FlashLong-horizon software engineering & agentic workflowsDeepSWE v1.1 frontier outperformance; 54.9% on HLE-VerifiedGeneral availability ($0.75 / $3.75 per 1M tokens)
Gemini 3.8 Flash CyberAutonomous vulnerability hunting & automated patching>70% across 20 languages; 47.2% CWE-Bench pass@1Vetted security teams via Google Fairwind Program

Google は、エクスプロイト能力ではなく、当初から防御を目的としたパッチ生成を意図的に優先したという。この方針に沿った自動修正能力について、Collinear が運営する外部ベンチマーク CWE-Bench では、Gemini 3.8 Flash Cyber が pass@1 で 47.2% を記録しており、主要なフロンティア・モデルの 47.8% に匹敵する数値を、大幅に低いコストで達成している。

Gemini 3.8 Flash Cyber CWE-Bench Pass@1 vs. Cost per Rollout
Gemini 3.8 Flash Cyber CWE-Bench Pass@1 vs. Cost per Rollout (Image Source: Google)

こうした能力は、実際の利用にも反映されており、このモデルは Google のコードベースの保護に利用されている。Chrome Security チームによると、より大規模な商用競合モデルと比較して、正しい脆弱性修正パッチを 2.6 倍多く生成したという。また、セキュリティ企業 Wiz のペネトレーション・テスト用ベンチマークでは、コストを 20%~50% に抑えながら再現率が 7.5~9.7% 高かったと測定されている。

さらに、特に注目されるのは、このモデルを利用する Google の Cloud Vulnerability Research チームが、基盤レベルの重大な脆弱性を 2 時間未満で発見した事例である。通常、この発見プロセスには数カ月にわたる手作業の調査が必要になることから、この事例はモデルによる自動化の効果を示すものといえる。

エージェント型推論/サイバー・セキュリティ分野に特化したトレーニングを組み合わせた Gemini 3.8 Flash Cyber が示すのは、攻撃者を上回る自動化の優位性を防御側にもたらそうとする Google の取り組みである。ただし、現時点における一般ユーザーによるアクセスは、信頼されたプログラム参加者に限定されている。