
GoogleがGemini 4 Argonを発表、出力100万トークンとサイバー防御に特化
Google DeepMindが次世代フロンティアモデル「Gemini 4 Argon」を発表した。信頼できるサイバー防御者向けのFairwind Programを通じて、まず限定的な提供を開始している。
このモデルは出力トークン上限を100万に拡大し、ソフトウェアエンジニアリングのベンチマークであるDeepSWE v1.1で77.9%を記録した。サイバーセキュリティのCWE-bench v1では68%で同率1位となっている。
一般提供の前には段階的な安全性検証を進める方針だ。本記事では発表された性能、Google社内での活用事例、価格、今後の展開予定を整理して解説する。
Gemini 4 Argonの概要と段階的な提供

Gemini 4 Argonの大きな特徴は、複雑で長期にわたるワークフローで深い推論を持続できる点にある。実世界のソフトウェアエンジニアリング、法律や金融などの企業知識作業、サイバーセキュリティ防御の各領域で最高水準の性能を発揮するとしている。
段階的な提供アプローチ
このレベルのフロンティア能力を安全に提供するには段階的な進め方が必要になる。Google DeepMindは米国政府のモデル事前アクセスに関する自主的なプロセスに積極的に関与しており、アクセスを徐々に拡大している。
早期テスターからフィードバックを集めながらガードレールを改善した上で、できるだけ早く開発者、企業、一般消費者に提供する方針だ。
このデモは提供の段階を示している。現在はサイバー防御者向けの提供が始まっており、フィードバックを反映した後に一般向けへ拡大する計画だ。
導入価格
料金は入力トークン100万個あたり2ドル、出力トークン100万個あたり10ドルに設定された。キャッシュ済みの入力トークンは入力価格から95%引きになる。
Google社内でのエージェント活用事例

Gemini 4 ArgonはすでにGoogle社内のワークフローで実用されている。数千人規模のGooglerが専門的なコーディング作業、深い調査、文章作成でモデルの強みを報告しているという。
量子アルゴリズムの最適化
量子コンピューティングの研究者は、重要なアプリケーションのボトルネックとなるサブルーチンについて、時空リソース(量子ビット×ゲート)を最適化する目的でArgonを使用している。ある例では公開されているベースラインを数分で40%上回った。
データセンターのメモリ効率化
Argonエージェントのチームがフリート全体のプロファイリングテレメトリを解析し、Googleのデータセンター全体でメモリ最適化を自律的に特定して適用した。展開後には300TiB超のメモリを解放し、合計の削減量は500TiBから1PiBと見積もられている。
大規模コードベースの移行
ArgonエージェントはGoogle全体でC/C++コードベースのRustへの移行に取り組んでいる。対象はコアライブラリのre2やlibgav1では数万行、Fuchsia Zirconカーネルでは80万行超に達する。
これらの大規模書き換えは、本番環境への展開前に厳格な自動監査と手動監査、エミュレーションテスト、レビューを受けている。
libgav1の例では、Argonエージェントが既存のRustポートをベースにSIMDコード32K行を置き換えた。多くのプロファイル誘導実験を繰り返し、コンパイラの出力を調査して、自動ベクトル化される安全なRustコードを生成した。結果として、同一の映像出力でRustポートより2.7倍高速なメモリ安全な動画デコーダが完成した。
技術仕様とベンチマーク結果

出力トークン上限を100万に拡大
長く複雑なユースケースを支えるため、出力トークンの上限は従来の64Kから業界最高水準の100万に大幅拡大された。モデルが深く思考し、1回の軌道で数十万トークンを生成できる余裕があると、難しい問題を一括で解く新しい推論の深さが生まれる。
主要ベンチマークの結果
ソフトウェアエンジニアリングの実世界タスクを測定するDeepSWE v1.1では77.9%を記録し、新たな最高水準を樹立した。Googleエンジニアは日々のデバッグから大規模コード移行、アルゴリズム設計までArgonを日常的に使用している。
コード生成以外でも、金融、コーディング、法律、税務作業の経済的影響を測定するVals Indexで首位を獲得した。Vals Finance Agent v2(多段階の金融リサーチ)やHarvey’s Legal Agent Benchmark(法的調査と文書作成)でも首位級の結果を出した。
ZapierのAutomationBench(主要なビジネス機能のエンドツーエンド実行を測定)では51.3%で1位となった。長尺動画の理解力を測定するLVBenchでは91.7%で最高水準を記録している。
DeepSWE v1.1とLVBenchでは最高水準、AutomationBenchでは単独1位、CWE-bench v1では同率1位という結果になっている。
サイバーセキュリティ防御への特化

新時代のサイバー攻撃に備えて、Gemini 4 Argonはサイバーセキュリティ防御に高い能力を持つように訓練された。重大なソフトウェア脆弱性を自律的に発見、検証、修正できる。信頼できる防御者とGoogle社内チーム向けには、サイバーガードレールなしで提供され、フロンティア級の防御能力を完全に活用できる。
脆弱性の発見と修正
CWE-bench v1(セキュリティ脆弱性の修正能力を評価するベンチマーク)では68%で首位タイを記録した。これは3.8 Flash CyberのCWE-bench v0でのフロンティア性能を基盤にしている。
内部の包括的な脆弱性ベンチマークでは、20のプログラミング言語にわたる複雑なコードベースから広範囲の露出を発見した。Wizの内部ブラックボックス侵入テストベンチマークでは、ソースコードなしでライブWebシステムを解析する能力が試され、攻撃対象の発見、脆弱性の特定、検証用の概念実証の生成において3.8 Flash Cyberを上回った。
Wizとの連携実績
クラウドセキュリティ企業のWizは、無償で重要な公共インフラを保護する取り組み「Scan for Good」を通じてArgonをサイバーセキュリティ防御に利用している。初期のデモでは、世界中の病院で使われる医療ソフトウェアに個人情報を漏えいさせる重大な脆弱性を発見した。これは以前のフロンティアモデルが見逃していた深刻なリスクだった。
Argonは従来モデルが見逃していた脆弱性を発見し、検証から修正まで自律的に対応できる点が実用上の大きな違いだ。
包括的な安全対策と展開ロードマップ

フロンティアモデルを広く提供する前に、Google DeepMindは四つの主要領域で安全性対策を強化している。それぞれの取り組みは、モデルの能力が高まるほど悪用や誤動作のリスクも高まるという前提に基づく。
誤用の防御
サイバー攻撃や化学・生物・放射性物質・核(CBRN)攻撃への悪用を防ぐため、Argonは有害な要求を拒否しつつ、正当なデュアルユース科学研究を保持する設計になっている。これはFrontier Safety Frameworkに沿ったものだ。
社内外のレッドチームによる手動および自動の攻撃手法を組み合わせた堅牢性テストを通じて、対策の効果を検証している。
プロンプトインジェクションへの耐性
悪意ある指示や文脈で外部からモデルの動作を乗っ取る間接的プロンプトインジェクションに対して、Argonはこれまでで最も高い耐性を持つ。自動レッドチーミングと敵対的トレーニングを通じて、Gray SwanのIndirect Prompt Injection(IPI)ベンチマークで最高水準を記録した。
システムの強化
モデルの思考連鎖と行動を監視し、ユーザーの意図を超えた行動を取ろうとした場合に実行を停止する仕組みも導入された。同様のシステムをトレーニング実行の監視にも使用し、専任のインシデント対応チームにアラートを送る運用を行っている。
エージェント制御ロードマップに沿って、高リスクのトレーニングや評価の前にサンドボックス環境を隔離・封印する対策も進めている。これらのベストプラクティスはパートナーと共有し、業界全体の安全性向上を目指す。
一般提供は有料API顧客とGoogle AI Ultra加入者から始まり、その後開発者、企業、一般消費者へと順次拡大される予定だ。
この記事のポイント
- Gemini 4 Argonは出力トークン上限100万、DeepSWE v1.1で77.9%を記録した
- Google社内では量子計算の最適化、メモリ300TiB削減、C/C++からRustへの大規模移行で実績を上げている
- サイバーセキュリティ防御に特化し、CWE-bench v1で68%の首位タイを達成した
- 価格は入力100万トークンあたり2ドル、出力同10ドルから始まる
- 一般提供は段階的に進められ、有料API顧客とGoogle AI Ultra加入者から開始される

・ 複数業界における17年間のデジタルビジネス開発経験
・ ウェブサイト開発のためのHTML、PHP、CSS、JavaScript等の実用的知識
・ 15ヶ国語対応の多言語SaaSの開発経験
・ 17年間にも及ぶ、Eコマース長期運営経験
・ 幅広い業界でのSEO最適化の豊富な経験



