月別アーカイブ: 2026年10月

Googleは旗艦モデル「Gemini 4 Argon」を発表、トークン出力容量を100万に大幅拡張、AIエージェントを強化しトップ集団に返り咲く

Googleは9月30日、次世代のフロンティアモデル「Gemini 4 Argon」を発表した。Gemini 4 Argonは、ソフトウェア開発や法務・財務などの知的労働において、フロンティアレベルの性能を発揮する。業界標準ベンチマークテストで、Gemini 4 ArgonはAnthropicとOpenAIに匹敵する性能を示し、一気にトップ集団に返り咲いた。また、Gemini 4 Argonは、サイバーセキュリティ機能が大きく進化し、ソフトウェアの脆弱性を検出する能力が格段に向上した。このため、GoogleはGemini 4 Argonを特定グループに限定して公開し、一般リリースはその後となる。

出典: Google

Gemini 4 Argonとは

Gemini 4 Argonは、「Geminiシリーズ」の最上位モデルで、ソフトウェア開発、企業の専門業務、サイバー防御で高度な機能を発揮する。最大の特徴は、業界トップクラスの「100万トークン出力」で、従来の容量を約15.6倍に拡張した。Gemini 4 Argonは、AIエージェントのブレインとして設計され、この大容量コンテキスト・ウィンドウを使い、エンジニアリングや知的労働で業界トップの性能を発揮する。

コンテキスト・ウィンドウ

Argonのコンテキスト・ウインドウの出力容量は、従来の64,000トークンから100万トークンに拡大された。トークンとは、AIが扱う情報の単位で、文字や単語の一部に相当する。単語数や文字数ではなく、モデルが処理する言葉の最小単位となる。100万トークンは、処理の結果を「出力」する容量となる。資料を読み込む「入力」の容量については、Googleは情報を公開していないが、200万トークンと予想されている。

出典: Generated with OpenAI GPT-6.1 Sol

大容量出力トークンが意味すること

AIモデルが出力する100万トークンは、約1,200〜1,500ページ(英文)に相当し、単行本で約3〜4冊の分量となる。通常の業務では100万トークンを出力することは稀である。しかし、難しい問題を思考する過程では、100万トークンの容量が必要になる。推論モデルは、考察の過程を「Chain of Thought(思考の連鎖)」として生成し、モデルはそれを読み返しながら、解答を組み立てる。最初の案で解決しない問題については、大規模な改修が必要になり、新たな「Chain of Thought」のツリーが生成される。このため、難しい問題を処理するAIエージェントは、大容量出力トークンが必要となる。

コーディング・エージェント能力

Googleは、長い思考過程を要するベンチマーク「DeepSWE v1.1」で、業界トップの成績(77.9%)をマークした(下のグラフ)。DeepSWEは、コーディング・エージェントの実戦的なソフトウェア開発能力を測定するためのベンチマークテストとなる。単純なプログラミングテストとは異なり、数時間に及ぶ長く複雑な開発タスク(Long-Horizon Tasks)を、AIが自律してやり遂げられるかを評価する指標となる。DeepSWEはAIエージェントのエンジニアリング能力を測定するための業界標準ベンチとなっている。

出典: Google

ナレッジワークで他社を圧倒

AIモデルの知的労働能力を評価するベンチマークテストで、Argonは圧倒的な成績をマークした(下のテーブル)。専門業務を評価する「Vals Index」で、Argonは68.9%の成績で、他社モデルを大きくリードした。Vals Indexは、金融、コーディング、法務、税務の課題を組み合わせ、各分野の米国GDPへの寄与を評価する試験となる。金融モデルの作成、法律の調査、税務の質問など、仕事に近い能力を評価する。数学や一般知識の問題で優れたモデルが、企業の専門業務でも同じように、能力を発揮できるかを検証するための指標となる。

出典: Google

サイバー防御を担うAIエージェント

Argonはサイバーセキュリティ機能が格段に強化された。サイバー攻撃を防御する能力のベンチマーク「CWE-bench v1」では、Argonは68%で、Grok 4.7、GPT-6 Astraと同率首位となった(下のグラフ)。CWE-bench v1は、AIエージェントのサイバーセキュリティ防御能力である、脆弱性の発見とこれを修正を測定するためのベンチマークテストとなる。AIがシステムの脆弱性を検知する能力に加え、システムを守るために正しく修正プログラムを開発・適用できるかが評価される。

出典: Google

Fairwind Program

Argonは、「Fairwind Program」のパートナーに提供され、コードのセキュリティを扱うエージェント「CodeMender」と組み合わせて利用される。脆弱性・ソフトウェアの弱点の発見から修正までを、AIが支援する仕組みとなる。Fairwind Programは、Googleが運用するプログラムで、サイバーセキュリティの防御者(ディフェンダー)に限定して、最先端のAIモデルを早期提供・運用するプラットフォームとなる。Googleは一般へのリリース時期について公開していないが、有料APIの顧客(Google AI Studioなど)、及び、上位サブスクリプションである「Google AI Ultra」の契約者への公開が次のステップとなる。

Googleの復活

Googleは今年2月にフラッグシップモデル「Gemini 3.1 Pro」を投入して以来、最上位モデルのリリースが途絶えていた。Googleは社内AI開発体制が大きく変わり、開発が難航していると言われてきた。8か月ぶりに旗艦モデル「Gemini 4 Argon」が発表され、Googleは再びトップ集団に加わった。Googleの強みは自社でAIプロセッサを開発していることで、垂直統合型企業として、高度なモデルがこれに続くと期待されている。