Google が Gemini 3.5 Flash Cyber を発表:脆弱性検出に特化した AI の登場

Google Launches Gemini 3.5 Flash Cyber to Find, Validate, and Patch Critical Vulnerabilities

2026/07/21 gbhackers — Google が公表したのは、深刻なソフトウェア脆弱性の発見/検証/修正を、セキュリティチームが大規模に実施するために設計された、軽量 AI モデル Gemini 3.5 Flash Cyber である。2026年7月21日に発表された SLM (Small Language Model) は、Gemini 3.5 Flash を基盤としてセキュリティ・ワークフロー向けに最適化されたものだ。これによりセキュリティ担当者は、大規模なコードベースを検査し、多数の実行パスを探索すると同時に、欠陥が疑われる部分に対して反復してテストを実施できる。

Google が Gemini 3.5 Flash Cyber を発表

当初、Google は、このモデルを政府機関および信頼できるパートナーを対象とした、アクセス制限付き CodeMender パイロット・プログラムを通じて提供する計画だった。それが強調していたのは、この技術のデュアルユースの可能性である。

今回のリリースは、AI システムが欠陥を特定する速度が、組織による調査/修正の速度を上回るという、ソフトウェア・セキュリティにおける拡大する不均衡の問題に対処するものだ。

CodeMender は、LLM による高コストな推論に依存するものではなく、サブエージェントを通じて Gemini 3.5 Flash Cyber を複数回呼び出すことで、より多くのコードパスを評価し、潜在的な問題を検証した上で、その結果を最終的な脆弱性レポートに統合するものだ。

Success Rate on Chrome Production Commit Scanning Pipeline (pass@1) (Source: Google )
Success Rate on Chrome Production Commit Scanning Pipeline (pass@1)
(Source: Google )

このアーキテクチャにより、モデルによる継続的なスキャン/コミット単位でのセキュリティ・チェック/時間的制約のあるリリース・パイプラインに適した環境が実現されると、Google は主張している。同社は、実在する数百件のソフトウェア脆弱性を取り込んだベンチマークである CyberGym を用いて、このモデルを評価している。

さらに、Google は CodeMender をコンフィグし、最終評価のために Gemini 3.5 Flash Cyber を最大 5 回呼び出すよう設定した結果、はるかに大規模なサイバー・セキュリティ特化型モデルに匹敵する結果が得られたと報告している。それに加えて、競合モデルの数値が自己申告によるものである点を、同社は強調している。

Google は、Chrome や Safari といった複雑なコードベースにおける、発見困難な脆弱性に焦点を当てた Big Sleep 評価でも、このモデルをテストした。Google によると、この評価環境において Gemini 3.5 Flash Cyber は、メインラインの Gemini 3.5 Flash および Gemini 3.6 Flash を大幅に上回る性能を発揮したという。

FeatureDetails
ModelGemini 3.5 Flash Cyber
Release dateJuly 2121, 20262026
Core purposeFind, validate, and patch software vulnerabilities
Foundation modelGemini 3.5 Flash
DeploymentCodeMender limited-access pilot
Initial accessGovernments and trusted partners
Main advantageLower-cost, high-frequency agentic vulnerability analysis
Target workflowsCodebase scanning, commit scanning, launch checks, vulnerability remediation
Broader availabilityCodeMender capabilities are also available through Gemini Enterprise Agent Platform using generally available Gemini models

さらに、ベンチマーク汚染を最小限に抑えるために、Chrome の未公開の脆弱性を用いた本番環境でのコミット・スキャン・パイプラインでは、標準の 3.5 Flash モデルと比較して著しい性能向上が確認された。

V8 JavaScript Engine のテストでは、このモデルが脆弱性の多様性に重点を置いていることが、さらに示されている。固定された評価回数において、Gemini 3.5 Flash Cyber は 555 件の固有の確認済み問題を特定し、Gemini 3.5 Flash の 474 件と、Claude Opus 4.6 の 363 件を上回った。

こうして発見された問題のうち 101 件が、比較対象となった 2 つのモデルで見逃されていたことを、Google は指摘している。それが示唆するのは、サイバー・セキュリティ向けに最適化されたモデルが、同じ欠陥クラスを繰り返して特定することを回避できる点である。

CyberGym Evaluation (Source: Google)
CyberGym Evaluation (Source: Google)

すでに Google は、Chrome/Android/Cloud/Ads/YouTube などの、さまざまなプラットフォームにおいて、この新しいモデルを社内展開している。同社の Cloud Vulnerability Research チームによると、公開 API におけるリモート・コード実行の脆弱性と、機密性の高い本番サービスにおけるメモリ破損問題を、わずか 2 時間以内に発見したという。さらに、このモデルは、ASLR や W^X による緩和策をバイパスする、信頼性の高いリモート・コード実行エクスプロイトの生成にも成功している。

このモデルのセキュリティ特化性を支える要因の一部として、同社が挙げているのは、OSV.dev データベースへのアクセスである。このデータベースには、70 万件以上のオープンソース脆弱性と、10 年以上にわたる OSS-Fuzz の発見結果が収録されている。