2026年9月30日、Google DeepMindは新しいフラッグシップモデルGemini 4 Argonを発表しました。Googleの最上位モデルの更新は、2026年2月のGemini 3.1 Pro以来です。9to5Googleの報道によると、予告されていたGemini 3.5 Proは結局登場せず、その間はGemini 3.7 Flash、3.8 FlashといったFlash系の更新が続いていました。
Googleの説明は「複雑で長時間のワークフローで深い推論を持続させる」モデルで、ソフトウェア開発、法務・金融などの企業向け知識労働、サイバー防御の3領域を主戦場に挙げています。出力トークンの上限は従来の6万4,000から100万トークンへ引き上げられました。
前回のGPT-6.1 Sol比較記事では、コーディングはClaude Opus 5.5とGPT-6 Astra、文章・資料作成はOpus 5.5が先頭でした。Argonはこの序列をどこまで動かすのでしょうか。
今回は、Gemini 4 ArgonをGemini 3.8 Flash、Claude Opus 5.5、Claude Fable 5.1、GPT-6 Astra、GPT-6.1 Solの5モデルと比べます。観点は前回と同じくコーディングと文章・資料作成の2つに絞り、長い資料を読んで作業する力(GDP.pdf)を補助的に確認します。あわせてAPI単価と1タスクあたりの実費、提供状況を整理します。
先に結論をまとめます。
- 総合力では、ArgonはGPT-6 AstraとClaude Fable 5.1に並びました。Googleのモデルが独立評価で最上位帯に入るのは久しぶりです。
- コーディングでは、ArgonはFable 5.1とGPT-6.1 Solを上回り、Opus 5.5とAstraに2〜2.5ポイント差まで迫りました。Gemini 3.8 Flashからは37ポイントの伸びです。
- 文章・資料作成では、Argonは6モデルの5位です。Opus 5.5との差は大きく、GPT-6.1 Solにも届いていません。
- 費用では、導入価格はGPT-6.1 Solと同額ですが、1タスクあたりの実費はSolの2.8倍でした。同じ単価でも、評価でのトークン使用量やキャッシュの使い方で実費は変わります。差の内訳は公表値だけでは確定できません。
- 提供状況は、現時点でサイバー防御機関向けの限定提供です。API有償顧客への展開時期は未定で、GitHub Copilotでも使えません。
本記事は2026年10月1日時点の公式発表と評価機関の公開データを整理したものです。当社で6モデルに同じ課題を解かせた実測記事ではありません。
まず結論:仕事ごとに比較したい候補
| やりたい仕事 | 最初に比較したい候補 | 判断のポイント |
|---|---|---|
| 複数ファイルの実装、調査、テストの反復 | Claude Opus 5.5 / GPT-6 Astra | 正答率はこの2モデルが先頭。Argonは2〜2.5ポイント差。総合評価全体の平均費用はOpus 5.5の3分の1、Astraの6割(開発作業単独の費用比は未確認) |
| 費用を抑えて開発作業を大量に回す | GPT-6.1 Sol(次にGemini 4 Argon) | Solは総合評価の1タスク平均費用が最も低い。Argonは正答率で1ポイント上回るが同費用は2.8倍 |
| 提案書・報告書・スライドなどの成果物 | Claude Opus 5.5(次にClaude Fable 5.1) | 業務成果物の評価でOpus 5.5が大差の首位。Argonは5位で、成果物用途は要確認 |
| 長いPDFを読み、細かな条件を満たして作業 | GPT-6 Astra / GPT-6.1 Sol | Argonは22%で3.8 Flashと並ぶ下位。英語資料の評価で、日本語は別途確認 |
| 既存のGemini 3.8 Flashの用途 | まず3.8 Flashを継続、Argon提供開始後に比較 | Argonは使えるようになってから。単価は3.8 Flashの2.7倍 |
Argonは「試す価値が高いが、まだ試せない」モデルです。Googleは有償API顧客とAI Ultra加入者への展開を予告していますが、時期は示していません。Gemini 3.8 Flashを使っている場合は、いまの用途を続けながら、Argonの提供開始後に同じ課題で比べる準備をしておくのが現実的です。
この表は、以下のデータから導いた試す順序の提案です。日本語の自然さや自社のコードとの相性まで、公開スコアで確定したものではありません。
Gemini 4 Argonで何が変わったのか
Googleの発表によると、Argonは「複雑で長時間のワークフローにわたって深い推論を持続する」ように作られたモデルです。実世界のソフトウェア開発、法務・金融などの企業向け知識労働、サイバー防御で最前線の性能を出すと説明しています。
最も目立つ変更は出力トークン上限の100万トークン化です。従来の6万4,000トークンから約16倍で、Googleは「モデルが深く考え、1回の応答で数十万トークンを生成できる余地があると、難しい問題を一度で解く推論の深さが加わる」と説明しています。長い作業を分割せずに1回で任せる、という使い方を想定した設計です。
価格は導入期間中、100万トークンあたり入力2ドル、出力10ドルです。キャッシュ済み入力は入力単価の95%引きで0.10ドルです。これはGPT-6.1 Solとまったく同じ単価です。導入期間の終了後は入力4ドル、出力20ドルに変わると案内されていますが、終了時期は示されていません。
提供の順序は次のとおりです。
- 現在:Fairwind Programに参加する信頼できるサイバー防御者(国のセキュリティ機関、重要インフラ事業者、セキュリティ研究者など)に限定提供
- 次に:API有償顧客とGoogle AI Ultra加入者
- その後:開発者、企業、一般ユーザーへ「できるだけ早く」
Googleは、米国政府の自主的な事前アクセス手続きに参加しながら、段階的に提供範囲を広げると説明しています。Techzineの報道は、Fairwind ProgramをAnthropicのProject Glasswing、OpenAIのDaybreakに相当する枠組みと位置づけています。最上位モデルを一般公開の前にサイバー防御へ回す流れは、各社に共通してきました。
なお、Argonは2026年10月1日時点でGitHub Copilotの対応モデル一覧に載っていません。Copilotで使えるGoogleのモデルは、引き続きGemini 3.8 Flashが最新です。
Googleが公表した評価値
Googleは発表で、ソフトウェア開発、知識労働、科学、長文脈、サイバーの各分野で競合モデルとの比較表を示しています。主なものを抜き出します。
| 評価(Google公表) | Gemini 4 Argon | Claude Opus 5.5 | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|---|
| DeepSWE v1.1(実務の開発作業) | 77.9% | 74.2% | 74.1% | 67.4% |
| FrontierSWE v2(難しい開発作業) | 55.0% | 62.3% | 65.5% | 56.3% |
| Terminal-Bench 4.0 | 57.4% | 66.4% | 58.2% | 57.9% |
| Vals Index(金融・法務・コード) | 68.9% | 67.0% | 63.1% | 65.8% |
| AutomationBench(業務自動化) | 51.3% | 42.5% | 41.4% | 31.4% |
| CWE-bench v1(脆弱性の修正) | 68.0% | 67.0% | 68.0% | 58.0% |
出典:Googleの発表の比較表(2026年10月1日取得)。競合モデルの値はGoogleが掲載したもので、同じ環境で測り直した比較ではありません。
Googleの表自体も、Argonがすべてで先頭ではないことを示しています。実務の開発作業(DeepSWE)では首位ですが、難しい開発作業(FrontierSWE v2)ではAstraに10.5ポイント、Opus 5.5に7.3ポイント劣ります。Terminal-Bench 4.0でもOpus 5.5に9ポイント差です。強い領域と弱い領域が分かれるモデルだと読めます。
比較の前提:同じ評価環境で測った数値を軸にする
各社の発表資料は、比べる相手、思考設定、実行環境がそれぞれ異なります。そこで本記事でも、独立評価機関Artificial Analysisが同じ環境で6モデルを測った数値を比較の軸にします。
使うのは、総合指標「Intelligence Index v4.3.2」を構成する10評価のうち、観点に合う4つです。
| 観点 | 使う評価 | 単位 |
|---|---|---|
| コーディング | Terminal-Bench 4.0 / SciCode | 正答率(%) |
| 文章・資料作成 | AA-Briefcase v1.1 | Eloレーティング |
| 資料を読んで作業 | GDP.pdf | 全項目合格率(%) |
数値は2026年10月1日に各モデルのページと比較ページから取得しました(Argon以外の4モデルは前回記事の9月30日取得値を10月1日に再確認しています)。設定は、各モデルで評価された最上位の思考設定です。Gemini 4 ArgonとGemini 3.8 Flashはhigh、GPT-6 AstraとGPT-6.1 Solはmax、ClaudeはmaxにAnthropic既定のフォールバックを加えた設定です。ArgonはFairwind Programの限定提供ですが、Artificial Analysisは発表と同日に評価結果を公開しています。
Argon以外の5モデルのうち4モデルは、前回記事(9月30日取得)と同じ値でした。Gemini 3.8 FlashはGPT-6 Astra比較記事(9月23日取得)以来の再取得で、AA-Briefcaseが1,206から1,202へ、Terminal-Bench 4.0が19.1%から20%へと、小幅に動いています(比較ページは整数表示のため、実際の変動幅は0.4〜1.4ポイントの範囲です)。なお、Gemini 3.8 Flashの個別評価の値は比較ページの整数表示から取ったため、小数点以下は省いています。
参考として、総合指標の値も示します。これは10評価をまとめた指数スコアで、正答率ではありません。
| モデル(設定) | Intelligence Index v4.3.2 |
|---|---|
| Claude Opus 5.5(max) | 58 |
| Gemini 4 Argon(high) | 53 |
| Claude Fable 5.1(max) | 53 |
| GPT-6 Astra(max) | 53 |
| GPT-6.1 Sol(max) | 52 |
| Gemini 3.8 Flash(high) | 41 |
出典:Artificial Analysis Intelligence IndexとGemini 4 Argonのページ(2026年10月1日取得)。
Argonは53で、AstraとFable 5.1に並びました。Gemini 3.8 Flashからは12ポイントの上昇です。Artificial Analysisは評価記事で、「Googleは知能の面で上位3ラボの1つに戻った」と評しています。ただし首位のOpus 5.5とは5ポイント差が残っており、「Googleが首位に立った」わけではありません。
コーディング力:Argonは上位2モデルに2〜2.5ポイント差まで迫った
コーディングは、Terminal-Bench 4.0を中心に見ます。ソフトウェア開発、機械学習、運用などの66件の作業を、ターミナル上で最後までやり遂げられるかを測る評価です。すべてのテストに通った場合だけ成功と数えます。Artificial Analysisは全モデルを同じ実行環境で動かし、各作業3回の平均を公表しています。
あわせて、科学計算のコードを書くSciCodeも並べました。
| モデル(設定) | Terminal-Bench 4.0 | SciCode |
|---|---|---|
| Claude Opus 5.5(max) | 59.6% | 66.9% |
| GPT-6 Astra(max) | 59.1% | 56.5% |
| Gemini 4 Argon(high) | 57.1% | 61.8% |
| GPT-6.1 Sol(max) | 56.1% | 54.2% |
| Claude Fable 5.1(max) | 52.0% | 63.1% |
| Gemini 3.8 Flash(high) | 20% | 57% |
出典:Artificial AnalysisのTerminal-Bench 4.0とSciCode、およびArgonの比較ページ(2026年10月1日取得)。
Flashからの伸びは37ポイント、上位との差は2ポイント台
ArgonのTerminal-Bench 4.0は57.1%で、Gemini 3.8 Flashの20%から37ポイント上がりました。首位のOpus 5.5とは2.5ポイント差、Astraとは2.0ポイント差です。GPT-6.1 Sol(56.1%)を1.0ポイント、Fable 5.1(52.0%)を5.1ポイント上回っています。
GPT-6 Astra比較記事で、Gemini 3.8 Flashは「難しい実装全般を同じように任せられるとは限らない」と書きました。Argonでこの差は大きく縮まり、Googleのモデルも難しい実装の候補に入るようになりました。
SciCodeは61.8%で、Opus 5.5(66.9%)、Fable 5.1(63.1%)に続く3位です。Astra(56.5%)とGPT-6.1 Sol(54.2%)を上回ります。1つの関数を正確に書く力でも、OpenAIの2モデルより高い値です。
なお、Terminal-Bench 4.0の首位はこの6モデルの外にあります。Artificial Analysisの同評価のページでは、Claude Sonnet 5.5(max)が63.6%で最高値です。Sonnet 5.5の記事で紹介したモデルで、コーディングではSonnet 5.5も候補に含めて比べる価値があります。
Googleの公表値と共通環境の数値には差がある
GoogleとArtificial Analysisの値を読み合わせると、Argon自身のTerminal-Bench 4.0は57.4%と57.1%でほぼ一致しています。一方、Opus 5.5はGoogleの表で66.4%、共通環境で59.6%と、6.8ポイントの開きがあります。Googleの表は競合の公表値を並べたものとみられ、Artificial Analysisは全モデルを同じ環境で3回ずつ動かした平均です。
どちらが「正しい」というより、測り方が違う数値だと理解しておくのが大切です。Googleの表では「Opus 5.5に9ポイント差」、共通環境では「2.5ポイント差」と、Argonの位置づけが変わります。導入判断には、同じ環境で測った共通環境の値のほうが向いています。
導入時は、自分たちが実際に使う開発ツール(Claude Code、Codex、GitHub Copilotなど)で、代表的な不具合修正を同じ開始地点から解かせて比べるのが確実です。ただしArgonは、Google AI StudioやVertex AIでの提供が始まるまでこの比較ができません。
文章・資料作成:Argonは5位、Opus 5.5との差は大きい
文章・資料作成には、事実を整理する力、構成する力、読みやすく仕上げる力が関わります。前回と同じく、業務の成果物を評価するAA-Briefcase v1.1を、文章・資料作成に近い指標として使います。
AA-Briefcaseは、データ分析や事業戦略など4つの複数週プロジェクト、計91件のタスクで、メモ・スライド・表計算などの成果物を作らせる評価です。次の3つを組み合わせて、Eloレーティングを算出します。
- 要件の達成:指示や資料に隠れた要件を満たし、正しい根拠で結論を出したか(合否判定の合格率)
- 分析の質:他のモデルの成果物と比べて、分析が徹底しているか(Elo)
- 見せ方:他のモデルの成果物と比べて、仕上がりが整っているか(Elo)
| モデル(設定) | 総合Elo | 95%信頼区間 |
|---|---|---|
| Claude Opus 5.5(max) | 1,822 | 1,810–1,834 |
| Claude Fable 5.1(max) | 1,678 | 1,669–1,688 |
| GPT-6 Astra(max) | 1,569 | 1,559–1,580 |
| GPT-6.1 Sol(max) | 1,564 | 1,555–1,573 |
| Gemini 4 Argon(high) | 1,494 | 1,484–1,504 |
| Gemini 3.8 Flash(high) | 1,202 | 1,193–1,212 |
出典:AA-Briefcaseリーダーボード(2026年10月1日取得)。Eloは相対評価であり、正答率や満点に対する達成率ではありません。
Flashから292点の伸び、しかし上位4モデルには届かない
Argonの総合Eloは1,494で、Gemini 3.8 Flashの1,202から292点上がりました。リーダーボード全体では32位です。伸び幅は大きいものの、Opus 5.5(1,822)とは328点、Fable 5.1(1,678)とは184点の差があります。GPT-6.1 Sol(1,564)にも70点届いておらず、信頼区間も重なりません。
内訳:要件の合格率は過去最高、見せ方は最下位
| モデル(設定) | 分析の質(Elo) | 見せ方(Elo) | 要件の合格率 |
|---|---|---|---|
| Claude Opus 5.5(max) | 2,207 | 1,710 | 61.2% |
| Claude Fable 5.1(max) | 1,999 | 1,486 | 61.5% |
| GPT-6.1 Sol(max) | 1,807 | 1,438 | 55.7% |
| GPT-6 Astra(max) | 1,777 | 1,535 | 52.0% |
| Gemini 4 Argon(high) | 1,576 | 1,308 | 65.0% |
出典:Artificial Analysisの評価記事と各モデルのページ(2026年10月1日取得)。Gemini 3.8 Flashの内訳は公開ページで確認できなかったため省いています。分析の質と見せ方は、それぞれ独立したEloです。
Argonの要件の合格率は65%で、Artificial Analysisが「記録した中で最も高い」と説明する値です。Opus 5.5(61.2%)やFable 5.1(61.5%)を上回ります。指示や資料に隠れた要件を拾い、正しい根拠で結論を出す力は、表の5モデルでは最も高く、Artificial Analysisの説明を踏まえれば3.8 Flashも含めて最上位と読めます。
一方、他のモデルの成果物と並べて比べる分析の質(1,576)と見せ方(1,308)は、いずれも表の5モデルで最下位です。特に見せ方は、Sol(1,438)より130点低い値です。要件は満たすが、分析の掘り下げと仕上がりの整い方で差がつく、というのがArgonの成果物の特徴です。報告書やスライドの体裁まで任せたい用途では、この点を確かめる必要があります。
総合力の指標で並んだAstraとは、文章・資料作成の評価で75点の差がつきました。総合力が同じでも、得意な仕事は違うという例です。
コーディングと文章・資料作成で、Argonの位置は逆転する
6モデルの順位を並べると、Argonの特徴がはっきりします。
| モデル | Terminal-Bench 4.0の順位 | AA-Briefcaseの順位 |
|---|---|---|
| Claude Opus 5.5 | 1 | 1 |
| GPT-6 Astra | 2 | 3 |
| Gemini 4 Argon | 3 | 5 |
| GPT-6.1 Sol | 4 | 4 |
| Claude Fable 5.1 | 5 | 2 |
| Gemini 3.8 Flash | 6 | 6 |
Argonはコーディングで3位、文章・資料作成で5位です。Fable 5.1がその逆(コーディング5位、文章・資料作成2位)で、2つのモデルは補完関係にあります。Googleが「ソフトウェア開発」を主戦場の先頭に置いたのは、この数値と整合しています。
Googleの発表では、企業向け知識労働の評価(Vals Indexや、法務のHarvey Legal Agent Benchmark)でArgonが首位だとしています。金融や法務の専門的な作業と、成果物を整えて仕上げる作業は、別の力として見たほうがよさそうです。
長いPDFを読んで専門的な作業をこなす力では、Argonは3.8 Flashからほぼ横ばい
前回の記事で取り上げたGDP.pdfも確認します。金融、医療、法務など10分野・計4,592ページのPDFを使う100件の専門作業で、1,275個ある細かな採点項目のうち、その作業の項目をすべて満たせた割合を見ます。
| モデル(設定) | GDP.pdf(全項目合格率) |
|---|---|
| GPT-6 Astra(max) | 31.0% |
| GPT-6.1 Sol(max) | 31.0% |
| Claude Opus 5.5(max) | 26.2% |
| Claude Fable 5.1(max) | 26.2% |
| Gemini 4 Argon(high) | 22% |
| Gemini 3.8 Flash(high) | 21% |
出典:Artificial AnalysisのGDP.pdfとArgonの比較ページ(2026年10月1日取得)。ArgonとGemini 3.8 Flashの値は比較ページの整数表示です。
Argonは22%で、3.8 Flash(21%)と並ぶ下位2モデルです。伸びは整数表示で1ポイントにとどまり、コーディングや総合力の伸びとは対照的です。Googleは長文脈の評価(GraphWalks、LVBench)で首位を主張していますが、長い資料を読める力と、その資料の細かな条件をすべて満たして成果物を出す力は、別の指標で確かめる必要があります。
なお、この評価は英語の資料を使っています。日本語の契約書や議事録を正しく読めるかは測られていません。
日本語の文章は、自分たちの原稿で比べる
AA-Briefcaseを含め、今回の評価は日本語の文章の自然さを測っていません。日本語で書かせる用途では、同じ資料を渡し、モデル名を伏せて読み比べる方法をおすすめします。比べる観点(事実への忠実さ、構成、自然な日本語、語調、修正への対応)は、GPT-6 Astra比較記事の比較表にまとめています。
価格:単価はGPT-6.1 Solと同額、1タスクの実費は2.8倍
API単価
6モデルの100万トークンあたりの単価を並べます。Argonは2026年10月1日時点でGitHub Copilotに未提供のため、今回は各社APIの公表単価で比べます。
| モデル | 入力 | キャッシュ読み取り | 出力 | 備考 |
|---|---|---|---|---|
| Gemini 4 Argon | $2.00 | $0.10 | $10.00 | 導入価格。終了後は入力$4.00・出力$20.00 |
| GPT-6.1 Sol | $2.00 | $0.10 | $10.00 | |
| Gemini 3.8 Flash | $0.75 | $0.075 | $3.75 | 2026年12月31日までの導入価格 |
| Claude Opus 5.5 | $4.00 | $0.20 | $20.00 | |
| Claude Fable 5.1 | $10.00 | $0.25 | $50.00 | |
| GPT-6 Astra | $10.00 | $1.00 | $50.00 |
出典:Googleの発表、Artificial Analysisの各モデルのページ、Copilotのモデル別料金(2026年10月1日取得)。Copilotの単価(Argonを除く5モデル)は各社APIと同じでした。
Argonの導入価格はGPT-6.1 Solと完全に同じで、Opus 5.5の半額、AstraとFable 5.1の5分の1です。Gemini 3.8 Flashの2.7倍です。導入価格の終了後はOpus 5.5と同額になります。
表に書ききれない条件もあります。
- 導入価格の期限:Argonの導入価格は終了時期が示されていません。Gemini 3.8 Flashは2026年12月31日までと明示されています。契約や見積もりに使う場合は、終了後の単価(Argonは入力$4・出力$20)で計算しておくのが安全です。
- 長文料金:GPT-6.1 SolとAstraは、入力が27万2,000トークンを超えると、リクエスト全体で入力とキャッシュが2倍、出力が1.5倍になります(Copilotのモデル別料金の長文料金の欄)。Argonに同様の条件があるかは、APIの仕様が公開されてから確認が必要です。
- キャッシュ書き込み:AnthropicとOpenAIのモデルは、キャッシュへの書き込みに入力単価の1.25倍がかかります。Googleのモデルには書き込み時の割増はありません(明示キャッシュの保存料金は別です)。
実際の費用は、モデルが使うトークン量で決まる
単価が同じでも、同じ仕事にかかる費用が同じとは限りません。モデルが考えたり試したりする量が違うためです。
Artificial Analysisは、総合評価を実行したときの1タスクあたりの平均費用を公表しています。
| モデル(設定) | 1タスクあたりの費用 | 1タスクあたりの出力トークン |
|---|---|---|
| Claude Fable 5.1(max) | $7.63 | 約7.8万 |
| Claude Opus 5.5(max) | $5.98 | 約11.9万 |
| GPT-6 Astra(max) | $3.26 | 約2.7万 |
| Gemini 4 Argon(high) | $1.99 | 約6.2万 |
| Gemini 3.8 Flash(high) | $1.24 | 約7.1万 |
| GPT-6.1 Sol(max) | $0.72 | 約3.8万 |
出典:Artificial Analysisの各モデルのページと比較ページ(2026年10月1日取得)。キャッシュの利用を含むIntelligence Index v4.3.2の実行費用です。
Argonの1タスクあたり費用は1.99ドルで、同じ総合指標のAstra(3.26ドル)の61%、Fable 5.1(7.63ドル)の26%です。Artificial Analysisも「Astraと同じ知能を、1タスクあたり6割の費用で」と整理しています。
一方、単価が同じGPT-6.1 Sol(0.72ドル)とは2.8倍の差がつきました。出力トークンはArgonが約6.2万、Solが約3.8万と1.6倍ですが、出力単価10ドルで計算すると差は約0.24ドルで、費用差1.27ドルの一部しか説明できません。残りは入力やキャッシュの使い方の差とみられますが、内訳は公表値だけでは確定できません。同機関のArgonのページによると、Argonが総合評価の全体で生成した出力は1億1,000万トークンで、同価格帯の推論モデルの中央値(8,200万)より多めでした。100万トークンの出力上限は、長く考えて一度で解くための設計ですが、費用の面では「たくさん考える分だけ払う」モデルでもあります。
Gemini 3.8 Flash(1.24ドル)との差は1.6倍です。単価は2.7倍なのに実費の差が小さいのは、3.8 Flashのほうが出力トークンを多く使う(約7.1万)ためです。GPT-6 Astra比較記事で触れたとおり、Googleは「3.8 Flashは長い作業で検証を重ね、トークン使用量が増える場合がある」と説明しており、これと整合します。
比較するなら、次の形で記録すると実態に近づきます。
完成までの総コスト = 全試行のAPI料金(またはクレジット)+ 人が確認・修正する時間の費用
GitHub Copilotで使うなら、まだGemini 3.8 Flash
前回と同じ条件で、Copilotのクレジット消費も確認しておきます。Copilot Pro+は月39ドルで、毎月7,000クレジット(1クレジット=0.01ドル)が含まれます(Copilotプラン比較)。新規の入力3万トークン、キャッシュ読み取り12万トークン、出力8,000トークンの1回の依頼で、キャッシュ書き込みなし、長文料金の対象外という前提です。
| モデル | 1回あたりのクレジット | Pro+の月7,000クレジットで使える回数 |
|---|---|---|
| Gemini 3.8 Flash | 6.15 | 1,138回 |
| GPT-6.1 Sol | 15.2 | 460回 |
| Claude Opus 5.5 | 30.4 | 230回 |
| Claude Fable 5.1 | 73 | 95回 |
| GPT-6 Astra | 82 | 85回 |
| Gemini 4 Argon | (10月1日時点で未提供) | (10月1日時点で未提供) |
出典:Copilotのモデル別料金(2026年10月1日取得)。単価表から計算した例で、実測ではありません。回数は端数を切り捨てています。Gemini 3.8 Flashなら、入力3万×75+キャッシュ12万×7.5+出力8,000×375を100万で割って、6.15クレジットになります。
ArgonがCopilotに来た場合、単価がGPT-6.1 Solと同じなら1回15.2クレジットで、Gemini 3.8 Flashの2.5倍です。ただし、上の実費の話のとおり、Argonは出力トークンを多く使う傾向があるため、実際の消費はこの試算より大きくなる可能性があります。
前回の比較から何が変わったか
前回(9月30日)の比較からの主な変化は、次の3つです。
- Googleが最上位帯に戻った:総合指標でArgonがAstra・Fable 5.1と同点の53になりました。9月の一連の比較記事で扱ったGoogleのモデルは、Flash系のみでした。
- コーディングの3位が入れ替わった:前回3位のGPT-6.1 Sol(56.1%)を、Argon(57.1%)が1ポイント上回りました。上位2モデル(Opus 5.5、Astra)は変わりません。
- 文章・資料作成の序列は変わらなかった:Opus 5.5、Fable 5.1、Astra、GPT-6.1 Solの順は動かず、Argonはその下に入りました。
Artificial Analysisの総合指標は、前回と同じv4.3.2です。今回は6モデルとも同じ版の点数を比べています。
まとめ:Argonは「コーディングで試す理由が増えた、まだ試せないモデル」
6モデルの公開評価から、仕事ごとの最初の候補は次のように整理できます。
- 難しい実装やターミナル作業:Opus 5.5とAstra。Argonは2〜2.5ポイント差の3位で、提供が始まれば試す価値がある
- 開発作業を大量に回す:GPT-6.1 Sol。Argonは正答率で1ポイント上回るが、総合評価の1タスク平均費用は2.8倍(開発作業単独の費用比は未確認)
- 提案書・報告書などの成果物:Opus 5.5。品質で次点はFable 5.1。Argonは5位で、成果物の仕上がりは要確認
- 長いPDFでの厳密な作業:AstraとGPT-6.1 Sol。Argonは3.8 Flashと並ぶ下位
- いまGoogleのモデルを使っている:3.8 Flashを継続し、Argonの提供開始後に同じ課題で比べる
Googleの「実世界のソフトウェア開発で最前線」という説明は、共通環境のコーディング評価でも上位2モデルに2ポイント台まで迫った点で整合しています。一方、文章・資料作成では、総合力で並んだAstraにも届いていません。1つのモデルで全部をまかなうより、仕事ごとに候補を分ける考え方は、Argonでも有効です。
もう1つ、今回の発表で確認しておきたいのは提供のされ方です。Argonは発表から一般提供まで間が空き、最初に使えるのはサイバー防御機関です。評価機関の数値は発表当日に出ましたが、開発者が自分の手で確かめられるのはこれからです。数値で候補に入れつつ、実際の判断は自分たちの課題で試せるようになってから、という順序を守るのが確実です。
フィールフロウのAI仕様駆動開発の視点では、モデル選びの前に、任せる作業と完了条件を決めたいと考えています。
- コードなら、対象の不具合が解消し、既存機能を壊さず、レビューを通せること。
- 文書なら、出典に忠実で、読者が理解でき、指定した語調へ整っていること。
- どちらも、API料金と人の確認時間を含めて、完成までを比較すること。
Googleが最上位争いに戻ったことで、最上位帯の選択肢は3社に広がりました。公開評価で候補を絞り、自分たちの代表的な仕事で確かめる。この手順を持っておけば、Argonの提供が始まったときも落ち着いて判断できます。


