2026年9月21日にSpaceXAI(旧xAI)のGrok 4.7、22日にAnthropicのClaude Opus 5.5と、OpenAIのGPT-6 Sol・GPT-6 Lunaが発表されました。わずか2日で主要モデルの顔ぶれが入れ替わった形です。
前回のGPT-6 Astra比較記事では、コーディングと文章・資料作成の公開評価を見ながら使い分けを整理しました。今回は同じ観点に文書読解とクレジット価格を加え、7モデルを比べます。
先に結論をまとめます。
- 難しいコーディングでは、Opus 5.5とGPT-6 Astraがほぼ同率で先頭です。
- 長文の読み取りは上位が僅差で、低価格のGPT-6 Lunaも上位とほぼ並びます。長いPDFで細かな条件を満たす作業はAstraが先頭です。
- 文書・資料作成では、Opus 5.5が大差で首位です。Grok 4.7が低い単価で3位に入りました。
- クレジット価格は、単価の表だけでは判断できません。同じ仕事でも、モデルによって使うトークン量が数倍違うからです。
本記事は2026年9月23日時点の公式発表と評価機関の公開データを整理したものです。当社で7モデルに同じ課題を解かせた実測記事ではありません。
まず結論:仕事ごとに比較したい候補
| やりたい仕事 | 最初に比較したい候補 | 判断のポイント |
|---|---|---|
| 複数ファイルの実装、調査、テストの反復 | Claude Opus 5.5 / GPT-6 Astra | 正答率はほぼ同率。思考設定によって費用が大きく変わる |
| 長い資料の要約・抽出を大量に処理する | GPT-6 Luna / GPT-6 Sol | 長文読解の評価は上位と僅差。単価が低い |
| 長いPDFを読み、細かな条件を満たして作業 | GPT-6 Astra / Claude Opus 5.5 | 最上位でも全条件を満たす割合は3割前後。人の確認を前提にする |
| 提案書・報告書・スライドなどの成果物 | Claude Opus 5.5(単価を抑えるならGrok 4.7) | 業務成果物の評価でOpus 5.5が大差の首位。Grok 4.7は3位 |
| 費用を最優先した大量の定型処理 | GPT-6 Luna / Gemini 3.8 Flash | 7モデルで単価が最も低い2つ。複雑な開発作業では評価が大きく下がる |
Claude Fable 5.1は、今回の評価の多くでOpus 5.5と同等か下回りました。入出力の単価はOpus 5.5の2.5倍です。Fable 5.1を使い続けている場合は、Opus 5.5との比較を優先して検討する価値があります。
この表は、以下のデータから導いた試す順序の提案です。日本語の自然さや自社のコードとの相性まで、公開スコアで確定したものではありません。
比較の前提:同じ評価環境で測った数値を軸にする
各社の発表資料は、比べる相手、思考設定、実行環境がそれぞれ異なります。そこで本記事では、独立評価機関Artificial Analysisが同じ環境で7モデルを測った数値を比較の軸にします。
使うのは、総合指標「Intelligence Index v4.3.2」を構成する10評価のうち、観点に合う5つです。
| 観点 | 使う評価 | 単位 |
|---|---|---|
| コーディング | Terminal-Bench 4.0 / SciCode | 正答率(%) |
| 文書読解 | AA-LCR v1.1 / GDP.pdf | 正答率・合格率(%) |
| 文書執筆・資料作成 | AA-Briefcase v1.1 | Eloレーティング |
数値は2026年9月23日に各モデルのページから取得しました。設定は、各モデルで評価された最上位の思考設定です(スコアが最も高い設定とは限りません)。ClaudeはmaxにAnthropic既定のフォールバックを加えた設定、GPT-6の3モデルはmax、Grok 4.7はxhigh、Gemini 3.8 Flashはhighです。
フォールバックとは、安全対策が働いた場面で別のモデルが処理を引き継ぐ仕組みです。Anthropicによると、Opus 5.5はサイバーセキュリティ関連の作業の多くをOpus 4.8へ引き継ぎます。
参考として、総合指標の値も示します。これは10評価をまとめた指数スコアで、正答率ではありません。
| モデル(設定) | Intelligence Index v4.3.2 |
|---|---|
| Claude Opus 5.5(max) | 58 |
| Claude Fable 5.1(max) | 53 |
| GPT-6 Astra(max) | 53 |
| GPT-6 Sol(max) | 48 |
| Grok 4.7(xhigh) | 46 |
| Gemini 3.8 Flash(high) | 41 |
| GPT-6 Luna(max) | 37 |
出典:Artificial Analysis Intelligence Index(2026年9月23日取得)。Opus 5.5の評価記事では、58点は同機関がこれまでに測った最高値と説明されています。
コーディング力:Opus 5.5とAstraがほぼ同率で先頭
コーディングは、Terminal-Bench 4.0を中心に見ます。ソフトウェア開発、機械学習、運用などの66件の作業を、ターミナル上で最後までやり遂げられるかを測る評価です。すべてのテストに通った場合だけ成功と数えます。
Artificial Analysisは全モデルを同じ実行環境(mini-swe-agent)で動かし、各作業3回の平均を公表しています。あわせて、科学計算のコードを書くSciCodeも並べました。
| モデル(設定) | Terminal-Bench 4.0 | SciCode |
|---|---|---|
| Claude Opus 5.5(max) | 59.6% | 66.9% |
| GPT-6 Astra(max) | 59.1% | 56.5% |
| Claude Fable 5.1(max) | 52.0% | 63.1% |
| GPT-6 Sol(max) | 43.9% | 57.6% |
| Grok 4.7(xhigh) | 25.8% | 57.4% |
| Gemini 3.8 Flash(high) | 19.7% | 56.6% |
| GPT-6 Luna(max) | 12.6% | 54.6% |
出典:Artificial AnalysisのTerminal-Bench 4.0とSciCode(2026年9月23日取得)。max設定同士では0.5ポイント差です。GPT-6 Astraはxhigh設定のほうが高く、Opus 5.5と同じ59.6%でした。
難しいターミナル作業では、Opus 5.5とAstraが同じ水準で並び、Fable 5.1が続きます。GPT-6 SolはGPT-5.6 Solの39.9%から伸びました。一方、Grok 4.7、Gemini 3.8 Flash、GPT-6 Lunaは大きく差が開いています。
SciCodeの差は小さく、Opus 5.5を除く6モデルが54.6〜63.1%に並びます。1つの関数を書く力と、長い作業を最後まで進める力は、別物として見たほうがよいでしょう。
各社の公表値は、実行環境が違うため高めに出ることがある
各社の発表資料には、上表と異なる数値が載っています。
- Anthropicは、Opus 5.5のTerminal-Bench 4.0を66.4%と公表しています(xhigh設定、自社の実行環境)。このほか、コードがそのまま取り込めるかを見るFrontierCode v1.1で54.4%、CursorBench 4.0で57.8%としています。
- SpaceXAIは、Grok 4.7のTerminal-Bench 4.0を37.6%と公表しています。上表の25.8%より高い値です。
- OpenAIは、長い開発作業を測るDeepSWE v1.1で、GPT-6 Solが68.8%、GPT-6 Lunaが66.6%と公表しています。
同じモデルでも、使う開発ツールや思考設定で数値が変わります。たとえばArtificial Analysisが、Grok 4.7をSpaceXAI純正の開発ツールGrok Buildで動かしたところ、Terminal-Bench 4.0は33%でした(Grok 4.7の評価記事)。同じ評価でも、共通環境の25.8%より高くなっています。
GPT-6 Lunaは、OpenAIの公表ではDeepSWE v1.1で66.6%と、Solの68.8%に近い値です。一方、共通環境のTerminal-Bench 4.0では12.6%にとどまります。ただし2つは評価も測定主体も異なるため、差の理由が作業の種類なのか実行環境なのかは、この数値だけでは確定できません。
導入時は、自分たちが実際に使う開発ツール(Claude Code、Codex、GitHub Copilotなど)で、代表的な不具合修正を同じ開始地点から解かせて比べるのが確実です。
文書読解:長文の読み取りは僅差、PDFの作業はAstraが先頭
文書読解は、前回にはなかった観点です。ここでは、長い資料を読んで答えを導く力と、長いPDFを読みながら専門的な作業を仕上げる力を、2つの評価で見ます。
- AA-LCR v1.1:1万〜10万トークンの資料(論文、財務資料、法律文書、業界レポートなど)を読み、離れた箇所の情報を組み合わせて答える100問の評価です。
- GDP.pdf:Surge AIが作った評価で、10分野・計4,592ページのPDFを使う100件の専門作業からなります。1回の試行で、1,275個ある細かな採点項目のうち、その作業の項目をすべて満たせた割合を見ます。
| モデル(設定) | AA-LCR v1.1 | GDP.pdf(全項目合格率) |
|---|---|---|
| Claude Opus 5.5(max) | 84.7% | 26.2% |
| Claude Fable 5.1(max) | 85.3% | 26.2% |
| GPT-6 Astra(max) | 80.7% | 31.0% |
| GPT-6 Sol(max) | 83.7% | 24.8% |
| GPT-6 Luna(max) | 83.3% | 20.4% |
| Grok 4.7(xhigh) | 76.7% | 20.0% |
| Gemini 3.8 Flash(high) | 81.3% | 21.0% |
出典:Artificial AnalysisのAA-LCRとGDP.pdf(2026年9月23日取得)。GPT-6 AstraのGDP.pdfは、xhigh設定では32.2%です。
長文の読み取りは、低価格モデルでも上位に近い
AA-LCRでは、Grok 4.7を除く6モデルが80.7〜85.3%の間に収まりました。1〜2ポイントの差で順位を決めるのは避けたほうがよいでしょう。
注目したいのは、入力単価が100万トークンあたり0.10ドルのGPT-6 Lunaが83.3%で、首位のFable 5.1と2ポイント差にあることです。長い資料の要約や情報の抜き出しを大量に処理するなら、まずLunaやSolで品質が足りるかを確かめる価値があります。
なお、Grok 4.7はGrok 4.6から3.7ポイント下がったと、Artificial Analysisは分析しています。
PDFで細かな条件をすべて満たすのは、まだ難しい
GDP.pdfでは、GPT-6 Astraが31.0%で先頭です。ただし最上位でも、採点項目をすべて満たせたのは3割ほどです。契約書や報告書のように1か所の見落としが問題になる作業では、どのモデルを選んでも人の確認を前提にする必要があります。
GDP.pdfの採点は、Artificial AnalysisがOpenAIのGPT-5.6 Luna(medium設定)を使って行っています。採点役が1社のモデルである点も、結果を読むときに覚えておきたい条件です。
また、どちらの評価も英語の資料を使っています。日本語の契約書や議事録を正しく読めるかは測られていません。
文書執筆・資料作成:Opus 5.5が大きく先行、Grok 4.7が3位
文書執筆には、事実を整理する力、構成する力、読みやすく仕上げる力が関わります。前回と同じく、業務の成果物を評価するAA-Briefcase v1.1を、文章・資料作成に近い指標として使います。
AA-Briefcaseは、データ分析や事業戦略など4つの複数週プロジェクト、計91件のタスクで、メモ・スライド・表計算などの成果物を作らせる評価です。次の3つを組み合わせて、Eloレーティングを算出します。
- 要件の達成:指示や資料に隠れた要件を満たし、正しい根拠で結論を出したか(合否判定の合格率)
- 分析の質:他のモデルの成果物と比べて、分析が徹底しているか(Elo)
- 見せ方:他のモデルの成果物と比べて、仕上がりが整っているか(Elo)
| モデル(設定) | 総合Elo | 95%信頼区間 |
|---|---|---|
| Claude Opus 5.5(max) | 1,822 | 1,810–1,834 |
| Claude Fable 5.1(max) | 1,678 | 1,669–1,688 |
| Grok 4.7(xhigh) | 1,657 | 1,648–1,666 |
| GPT-6 Astra(max) | 1,569 | 1,559–1,580 |
| GPT-6 Sol(max) | 1,483 | 1,473–1,493 |
| GPT-6 Luna(max) | 1,299 | 1,290–1,308 |
| Gemini 3.8 Flash(high) | 1,202 | 1,192–1,212 |
出典:AA-Briefcaseリーダーボードと各モデルのページ(2026年9月23日取得)。Eloは相対評価であり、正答率や満点に対する達成率ではありません。
Opus 5.5は、分析と見せ方の両方で先頭
| モデル(設定) | 分析の質(Elo) | 見せ方(Elo) | 要件の合格率 |
|---|---|---|---|
| Claude Opus 5.5(max) | 2,207 | 1,710 | 61.2% |
| Claude Fable 5.1(max) | 1,999 | 1,486 | 61.5% |
| Grok 4.7(xhigh) | 1,994 | 1,499 | 55.4% |
| GPT-6 Astra(max) | 1,777 | 1,535 | 52.0% |
| GPT-6 Sol(max) | 1,652 | 1,473 | 46.9% |
| GPT-6 Luna(max) | 1,382 | 1,347 | 37.4% |
| Gemini 3.8 Flash(high) | 1,151 | 1,200 | 42.1% |
分析の質と見せ方は、それぞれ独立したEloです。総合Eloの内訳として足し引きできる値ではありません。
Opus 5.5は2位のFable 5.1を140点以上上回り、信頼区間も重なりません。分析の質と見せ方の両方で7モデルの先頭です。Artificial Analysisは、Anthropicのモデルが見せ方の評価でGPT-5.6 Solを初めて上回ったと説明しています。
既定の思考設定であるmediumでも、Opus 5.5の総合Eloは1,642でした。これはGPT-6 Astraのmax設定(1,569)を上回る値です。
一方、要件の合格率はFable 5.1が61.5%で、Opus 5.5の61.2%とほぼ並びます。指示や資料の条件を拾う力は、両者でほとんど変わらないと読めます。
Grok 4.7は、低い単価で3位に入った
Grok 4.7は1,657点で、Fable 5.1に21点差の3位です。分析の質は1,994点、見せ方は1,499点で、どちらもFable 5.1(1,999点・1,486点)とほぼ並びます。差がついたのは要件の合格率で、Fable 5.1の61.5%に対しGrok 4.7は55.4%でした。指示や資料に隠れた条件を拾う精度に開きがあります。
Grok 4.7のAPI単価は、100万トークンあたり入力2ドル・出力6ドルです。必要な要件を人がチェックリストで確かめる運用なら、有力な候補になります。
GPT-6 SolとLunaは、資料作成で伸びていない
GPT-6 Solの1,483点は、GPT-5.6 Solの1,487点とほぼ同じです。GPT-6 Lunaは約45点下がりました。Artificial Analysisは、別の業務評価GDPval-AAでも両モデルの低下を確認しています。成果物の目視確認では、見せ方の質の低下と、必要な要素の書き漏れが主な原因だったとしています(GPT-6 Sol・Lunaの評価記事)。
なお、前回記事のAA-Briefcaseとは版と取得日が異なります。Eloは評価対象の追加で再計算されるため、前回の数値との増減をモデルの性能変化と読み替えないでください。
各社が主張する「読みやすさ」の改善
AnthropicとOpenAIは、どちらも今回の新モデルで文章の伝わりやすさを改善したと説明しています。以下は各社の発表と社内評価であり、独立した評価ではありません。
- Anthropic:Opus 5.5は、大事な情報を先に書き、専門用語や独特な言い回しが減り、与えた文章ルールに従うとしています。社内試験では、企業の四半期業績レポートを作らせ、数字や引用を自動で出典と照合しました。1つでも捏造があれば不合格になる品質基準を、Opus 5.5は18本中16本で満たし、Fable 5.1とOpus 5は1本も満たさなかったと述べています(Anthropicの発表)。
- OpenAI:GPT-6 SolとLunaに、Astraの伝え方を取り入れたとしています。明快さが増し、専門用語や不自然な言い回しが減り、回答はやや短くなるそうです。事実の誤りについても、Solは社内評価でGPT-5.6 Solの約半分になったと述べています(OpenAIの発表)。
両社がそろって掲げたことから、読みやすさが性能と並ぶ改善対象になってきたことがうかがえます。
日本語の文章は、自分たちの原稿で比べる
AA-Briefcaseを含め、今回の評価は日本語の文章の自然さを測っていません。日本語で書かせる用途では、同じ資料を渡し、モデル名を伏せて読み比べる方法をおすすめします。比べる観点(事実への忠実さ、構成、自然な日本語、語調、修正への対応)は、前回記事の比較表にまとめています。
クレジット価格:Copilotでは1クレジット=0.01ドル
最後に費用を見ます。7モデルはすべて、GitHub Copilotで一般提供されています(GPT-6 SolとLunaは順次展開)。Copilotの利用料はGitHub AI Creditsで計算され、1クレジットは0.01ドルです。
使ったトークン数にモデルごとの単価を掛け、クレジットに換算する仕組みです。今回の7モデルでは、入力・出力の単価が各社APIと同じでした。
下表は、100万トークンあたりの単価をクレジットで示したものです。100で割ると米ドルになり、Opus 5.5なら入力4ドル・出力20ドルです。
| モデル | 入力 | キャッシュ読み取り | 出力 |
|---|---|---|---|
| Claude Opus 5.5 | 400 | 20 | 2,000 |
| Claude Fable 5.1 | 1,000 | 25 | 5,000 |
| GPT-6 Astra | 1,000 | 100 | 5,000 |
| GPT-6 Sol | 200 | 20 | 1,000 |
| GPT-6 Luna | 10 | 1 | 50 |
| Grok 4.7 | 200 | 50 | 600 |
| Gemini 3.8 Flash | 75 | 7.5 | 375 |
出典:Copilotのモデル別料金、Copilotの対応モデル(2026年9月23日取得)。
使えるプランにも違いがあります。GPT-6 Luna、Gemini 3.8 Flash、Grok 4.7は、Proを含むすべての有料プランで使えます。Opus 5.5、Fable 5.1、GPT-6 Astra、GPT-6 SolはProでは使えず、Pro+・Max・Business・Enterpriseが対象です。
表には書ききれない条件もあります。
- 長文料金:GPT-6の3モデルは入力が27万2,000トークンを超えると、リクエスト全体で入力とキャッシュが2倍、出力が1.5倍になります。Grok 4.7は入力が20万トークンを超えると、入力・キャッシュ・出力とも2倍です。
- キャッシュ書き込み:AnthropicとOpenAIのモデルは、キャッシュへの書き込みにも入力単価の1.25倍がかかります。Opus 5.5なら100万トークンあたり500クレジット($5)です。
- 期間限定価格:Gemini 3.8 Flashの単価は2026年12月31日までのプロモーション価格です。GoogleのAPIでは、2027年1月1日から入力$1.50・出力$7.50になると案内されています(Googleの開発者向け案内)。
- 値下げ:Opus 5.5はOpus 5から入出力が20%、キャッシュ読み取りが60%安くなりました。GPT-6 SolとLunaは、GPT-5.6の期間限定価格から50%下がっています。
Copilotの定額プランには、毎月のクレジットが含まれます。Proは月10ドルで1,500クレジット、Pro+は月39ドルで7,000クレジット、Maxは月100ドルで20,000クレジットです。Businessは1ユーザーあたり月19ドルで1,900、Enterpriseは月39ドルで3,900クレジットが付きます(Copilotプラン比較)。
Fable 5.1だけは、安全対策のためにプロンプトと出力がAnthropic側で既定保持されるとGitHubが案内しています。機密性の高いコードを扱う組織は、管理者設定と保持条件もあわせて確認してください。
試算:同じトークン量なら何クレジットか
たとえば、次の量を使う1回の依頼を考えます。新規の入力3万トークン、キャッシュ読み取り12万トークン、出力8,000トークンです。キャッシュ書き込みはなく、長文料金の対象外という前提の計算です。
| モデル | 1回あたりのクレジット | Pro+の月7,000クレジットで使える回数 |
|---|---|---|
| Claude Opus 5.5 | 30.4 | 230回 |
| Claude Fable 5.1 | 73 | 95回 |
| GPT-6 Astra | 82 | 85回 |
| GPT-6 Sol | 16.4 | 426回 |
| GPT-6 Luna | 0.82 | 8,536回 |
| Grok 4.7 | 16.8 | 416回 |
| Gemini 3.8 Flash | 6.15 | 1,138回 |
これは単価表から計算した例で、実測ではありません。回数は端数を切り捨てています。Opus 5.5なら、入力3万×400+キャッシュ12万×20+出力8,000×2,000を100万で割って、30.4クレジットになります。
実際の費用は、モデルが使うトークン量で決まる
上の試算は、どのモデルも同じトークン数を使う前提です。実際には、同じ仕事でも、モデルが考えたり試したりする量が大きく違います。
Artificial Analysisは、総合評価を実行したときの1タスクあたりの平均費用を公表しています。
| モデル(設定) | 1タスクあたりの費用 | 1タスクあたりの出力トークン |
|---|---|---|
| Claude Fable 5.1(max) | $7.63 | 約7.8万 |
| Claude Opus 5.5(max) | $5.98 | 約11.9万 |
| Grok 4.7(xhigh) | $3.74 | 約8.1万 |
| GPT-6 Astra(max) | $3.26 | 約2.7万 |
| Gemini 3.8 Flash(high) | $1.24 | 約7.1万 |
| GPT-6 Sol(max) | $1.06 | 約3.1万 |
| GPT-6 Luna(max) | $0.07 | 約5.1万 |
出典:Artificial Analysisの各モデルのページと評価記事(2026年9月23日取得)。キャッシュの利用を含むIntelligence Index v4.3.2の実行費用です。
ここに大事な逆転があります。Opus 5.5の単価はAstraの4割ですが、max設定で総合評価を解かせると、1タスクの費用はOpus 5.5のほうが高くなりました。同じ課題を解くのに使うトークンが全体として多く、キャッシュの読み書きを含む入力側の費用もAstraの約1.9倍になったためです。出力トークンだけを見ると、Astraの約4.4倍でした。Grok 4.7も、単価はAstraの数分の1なのに、1タスクの費用はAstraを上回っています。
一方でAnthropicは、既定のmedium設定ならOpus 5.5の費用は大きく下がると説明しています。一般的な作業ではOpus 5より40%安く、FrontierCodeではAstraの最高点を約5分の1の費用で上回ったとしています。どの思考設定で使うかが、単価と同じくらい費用を左右します。
比較するなら、次の形で記録すると実態に近づきます。
完成までの総コスト = 全試行のクレジット(API料金)+ 人が確認・修正する時間の費用
ClaudeやChatGPTのアプリの定額プランは、Copilotのクレジットとは別の仕組みです。Anthropicは今回、Pro・Max・Teamなどの5時間あたり利用上限を引き上げました。OpenAIはSolとLunaをChatGPT WorkとCodexで提供し、無料のFreeプランと低価格のGoプランでもデスクトップアプリからLunaを使えるとしています。
前回の比較から何が変わったか
前回(9月5日)の比較からの主な変化は、次の3つです。
- Opus 5.5がFable 5.1を上回った:総合指標、コーディング、資料作成でFable 5.1を上回り、単価は4割です。
- GPT-6 SolとLunaは、ほぼ同じ性能で費用が半分以下に:Artificial Analysisの総合指標はGPT-5.6とほぼ同じまま、1タスクの費用はSolで約50%、Lunaで約60%下がりました。
- Grok 4.7が資料作成の上位に入った:コーディングでは差がある一方、業務成果物の評価ではFable 5.1に迫ります。
また、Artificial Analysisの総合指標は、前回のv4.2からv4.3.2へ更新されています。版が違う点数は、そのまま比べられません。
まとめ:モデル名より先に、任せる仕事と完了条件を決める
7モデルの公開評価から、仕事ごとの最初の候補は次のように整理できます。
- 難しい実装やターミナル作業:Opus 5.5とAstra。思考設定ごとの費用を測って選ぶ
- 長文の要約・抽出:Luna、Sol。品質が足りない箇所だけ上位モデルへ回す
- 長いPDFでの厳密な作業:Astra、Opus 5.5。どのモデルでも人の確認を前提にする
- 提案書・報告書などの成果物:Opus 5.5。費用を抑えるならGrok 4.7も比べる
- 大量の定型処理:Luna、Gemini 3.8 Flash。7モデルで単価が最も低い
フィールフロウのAI仕様駆動開発の視点では、モデル選びの前に、任せる作業と完了条件を決めたいと考えています。
- コードなら、対象の不具合が解消し、既存機能を壊さず、レビューを通せること。
- 文書なら、出典に忠実で、読者が理解でき、指定した語調へ整っていること。
- どちらも、クレジットの消費量と人の確認時間を含めて、完成までを比較すること。
新しいモデルは、これからも短い間隔で登場します。公開評価で候補を絞り、自分たちの代表的な仕事で確かめる。この手順を持っておけば、次のモデルが出たときも落ち着いて判断できます。


