Google Launches Gemini 3.5 Flash Cyber to Find, Validate, and Patch Critical Vulnerabilities
2026/07/21 gbhackers — Google が公表したのは、深刻なソフトウェア脆弱性の発見/検証/修正を、セキュリティチームが大規模に実施するために設計された、軽量 AI モデル Gemini 3.5 Flash Cyber である。2026年7月21日に発表された SLM (Small Language Model) は、Gemini 3.5 Flash を基盤としてセキュリティ・ワークフロー向けに最適化されたものだ。これによりセキュリティ担当者は、大規模なコードベースを検査し、多数の実行パスを探索すると同時に、欠陥が疑われる部分に対して反復してテストを実施できる。

Google が Gemini 3.5 Flash Cyber を発表
当初、Google は、このモデルを政府機関および信頼できるパートナーを対象とした、アクセス制限付き CodeMender パイロット・プログラムを通じて提供する計画だった。それが強調していたのは、この技術のデュアルユースの可能性である。
今回のリリースは、AI システムが欠陥を特定する速度が、組織による調査/修正の速度を上回るという、ソフトウェア・セキュリティにおける拡大する不均衡の問題に対処するものだ。
CodeMender は、LLM による高コストな推論に依存するものではなく、サブエージェントを通じて Gemini 3.5 Flash Cyber を複数回呼び出すことで、より多くのコードパスを評価し、潜在的な問題を検証した上で、その結果を最終的な脆弱性レポートに統合するものだ。
このアーキテクチャにより、モデルによる継続的なスキャン/コミット単位でのセキュリティ・チェック/時間的制約のあるリリース・パイプラインに適した環境が実現されると、Google は主張している。同社は、実在する数百件のソフトウェア脆弱性を取り込んだベンチマークである CyberGym を用いて、このモデルを評価している。
さらに、Google は CodeMender をコンフィグし、最終評価のために Gemini 3.5 Flash Cyber を最大 5 回呼び出すよう設定した結果、はるかに大規模なサイバー・セキュリティ特化型モデルに匹敵する結果が得られたと報告している。それに加えて、競合モデルの数値が自己申告によるものである点を、同社は強調している。
Google は、Chrome や Safari といった複雑なコードベースにおける、発見困難な脆弱性に焦点を当てた Big Sleep 評価でも、このモデルをテストした。Google によると、この評価環境において Gemini 3.5 Flash Cyber は、メインラインの Gemini 3.5 Flash および Gemini 3.6 Flash を大幅に上回る性能を発揮したという。
| Feature | Details |
|---|---|
| Model | Gemini 3.5 Flash Cyber |
| Release date | July 21, 2026 |
| Core purpose | Find, validate, and patch software vulnerabilities |
| Foundation model | Gemini 3.5 Flash |
| Deployment | CodeMender limited-access pilot |
| Initial access | Governments and trusted partners |
| Main advantage | Lower-cost, high-frequency agentic vulnerability analysis |
| Target workflows | Codebase scanning, commit scanning, launch checks, vulnerability remediation |
| Broader availability | CodeMender capabilities are also available through Gemini Enterprise Agent Platform using generally available Gemini models |
さらに、ベンチマーク汚染を最小限に抑えるために、Chrome の未公開の脆弱性を用いた本番環境でのコミット・スキャン・パイプラインでは、標準の 3.5 Flash モデルと比較して著しい性能向上が確認された。
V8 JavaScript Engine のテストでは、このモデルが脆弱性の多様性に重点を置いていることが、さらに示されている。固定された評価回数において、Gemini 3.5 Flash Cyber は 555 件の固有の確認済み問題を特定し、Gemini 3.5 Flash の 474 件と、Claude Opus 4.6 の 363 件を上回った。
こうして発見された問題のうち 101 件が、比較対象となった 2 つのモデルで見逃されていたことを、Google は指摘している。それが示唆するのは、サイバー・セキュリティ向けに最適化されたモデルが、同じ欠陥クラスを繰り返して特定することを回避できる点である。
すでに Google は、Chrome/Android/Cloud/Ads/YouTube などの、さまざまなプラットフォームにおいて、この新しいモデルを社内展開している。同社の Cloud Vulnerability Research チームによると、公開 API におけるリモート・コード実行の脆弱性と、機密性の高い本番サービスにおけるメモリ破損問題を、わずか 2 時間以内に発見したという。さらに、このモデルは、ASLR や W^X による緩和策をバイパスする、信頼性の高いリモート・コード実行エクスプロイトの生成にも成功している。
このモデルのセキュリティ特化性を支える要因の一部として、同社が挙げているのは、OSV.dev データベースへのアクセスである。このデータベースには、70 万件以上のオープンソース脆弱性と、10 年以上にわたる OSS-Fuzz の発見結果が収録されている。
訳者後書:今回の記事で取り上げた問題の背景には、AI システムがソフトウェアの欠陥を見つける速度に対して、組織側の調査や修正が追いつかないという、セキュリティ対応において拡大する不均衡があります。コードベースが大規模かつ複雑化する中で、従来の開発プロセスや単一のモデルによる検出では、多様な実行パスや複雑なメモリ破損問題などをタイムリーに検証しきれない点が課題となっていました。今回登場した Gemini 3.5 Flash Cyber は、複数回の効率的な呼び出しと豊富な脆弱性データの活用により、こうした調査能力の不足や重複検知という要因を解消し、スピーディーな対応をサポートします。


You must be logged in to post a comment.