GPT-6.1 Sol登場:Astra級の性能を5分の1の価格で? Opus 5.5・Fable 5.1・Grok 4.7とコーディング・文章作成を比較

OpenAIがGPT-6 Solの発表から7日でGPT-6.1 Solを投入しました。「Astraに迫る性能を5分の1の価格で」という主張は本当か。GPT-6.1 SolとGPT-6 Sol・GPT-6 Astra・Claude Opus 5.5・Claude Fable 5.1・Grok 4.7の計6モデルを、同じ評価環境のコーディングと文章・資料作成の公開評価、API単価とGitHub Copilotのクレジットで比較し、仕事ごとの選び方を整理します。

著者
岡崎 太
CTO / AIアーキテクト
公開日
読了時間
24分で読めます
Share

2026年9月29日、OpenAIは開発者向けイベントDevDayでGPT-6.1 Solを発表しました。GPT-6 Solの発表からわずか7日後の後継モデルです。

OpenAIの説明は明快です。「難しい作業でGPT-6 Astraに迫る性能を、Astraの5分の1の価格で」。前回の7モデル比較記事では、GPT-6 Solは「長文の要約・抽出に向く低価格モデル」という位置づけでした。6.1で、その位置づけは変わるのでしょうか。

今回は、GPT-6.1 SolをGPT-6 Sol、GPT-6 Astra、Claude Opus 5.5、Claude Fable 5.1、Grok 4.7の5モデルと比べます。観点は、読者の関心が高いコーディングと文章・資料作成の2つに絞り、あわせてAPI単価とGitHub Copilotのクレジットを整理します。

先に結論をまとめます。

  • コーディングでは、GPT-6.1 SolがOpus 5.5とAstraに3〜3.5ポイント差まで迫りました。GPT-6 Solからは12ポイントの伸びです。
  • 文章・資料作成では、Opus 5.5が引き続き大差の首位です。GPT-6.1 SolはAstraとほぼ同じ水準まで上がりましたが、Fable 5.1とGrok 4.7には届いていません。
  • 費用では、GPT-6.1 Solが6モデルで最も安く、総合評価の1タスクあたり費用はAstraの4分の1以下、Opus 5.5の8分の1でした。
  • OpenAIが名指しで比べたPDFを読んで答える専門作業(GDP.pdf)では、GPT-6.1 SolがOpus 5.5を上回り、Astraと並びました。

本記事は2026年9月30日時点の公式発表と評価機関の公開データを整理したものです。当社で6モデルに同じ課題を解かせた実測記事ではありません。

まず結論:仕事ごとに比較したい候補

やりたい仕事 最初に比較したい候補 判断のポイント
複数ファイルの実装、調査、テストの反復 Claude Opus 5.5 / GPT-6 Astra 正答率はほぼ同率。GPT-6.1 Solは3ポイント差で費用が4分の1以下
費用を抑えて開発作業を大量に回す GPT-6.1 Sol 上位2モデルに迫る正答率で、1タスクの費用が最も低い
長いPDFを読み、細かな条件を満たして作業 GPT-6.1 Sol / GPT-6 Astra 全項目合格率は両者が同率で先頭。ただし3割ほどで、人の確認が前提
提案書・報告書・スライドなどの成果物 Claude Opus 5.5(単価を抑えるならGrok 4.7) 業務成果物の評価でOpus 5.5が大差の首位。Grok 4.7は3位
既存のGPT-6 Solの用途 GPT-6.1 Solへ切り替えを検討 単価は同じで、キャッシュ読み取りが半額。評価はほぼ全項目で上回る

GPT-6 Solを使っている場合は、6.1への切り替えを優先して検討する価値があります。Artificial Analysisは、GPT-6.1 Solがすべての思考設定で費用対性能の最前線を押し広げたと分析しています。同じ知能水準でこれより安いモデルはない、という趣旨です。

この表は、以下のデータから導いた試す順序の提案です。日本語の自然さや自社のコードとの相性まで、公開スコアで確定したものではありません。

GPT-6.1 Solで何が変わったのか

OpenAIの発表によると、GPT-6.1 Solはコードの作成とデバッグ、文書の理解、複数ステップの業務ワークフローの実行で、GPT-6 Solから大幅に性能を上げたモデルです。総合力ではGPT-6 Astraが引き続き同社の最上位モデルだと明記しています。

価格は据え置きです。API単価は100万トークンあたり入力2ドル、出力10ドルでGPT-6 Solと同じです。変わったのはキャッシュ済み入力で、0.20ドルから0.10ドルへ半額になりました。標準の入力料金から95%引きです。同じ文脈を繰り返し読むエージェント処理では、この差が効きます。

提供先は、ChatGPTのPlus・Pro・Business・Enterprise・Eduの各プラン向けにChatGPT WorkとCodexで提供され、APIでも使えます。APIのモデル名はgpt-6.1-solです。GitHub Copilotでも同日から使えます(GitHubの告知)。

あわせて、最大8倍の速度で応答するUltrafast版も発表されました。GPT-6.1 Sol Ultrafastは、「従来のGPT-6 Astraとほぼ同じAPIコストで、Astraに迫る知能を最大8倍の速度で使える」と説明されています。速度と引き換えに単価が上がる仕組みなので、応答速度が価値になる用途(対話型の支援、リアルタイムの補完)で検討する選択肢です。

なお、TechCrunchの報道によると、同時期に準備されていたAstraの後継は、安全上の懸念から出荷が見送られたとされています。今回の「Sol中心の更新」を読むうえで、背景として覚えておきたい点です。

比較の前提:同じ評価環境で測った数値を軸にする

各社の発表資料は、比べる相手、思考設定、実行環境がそれぞれ異なります。そこで本記事でも、独立評価機関Artificial Analysisが同じ環境で6モデルを測った数値を比較の軸にします。

使うのは、総合指標「Intelligence Index v4.3.2」を構成する10評価のうち、観点に合う4つです。

観点 使う評価 単位
コーディング Terminal-Bench 4.0 / SciCode 正答率(%)
文章・資料作成 AA-Briefcase v1.1 Eloレーティング
資料を読んで作業 GDP.pdf 全項目合格率(%)

数値は2026年9月30日に各モデルのページから取得しました。設定は、各モデルで評価された最上位の思考設定です。GPT-6.1 Sol、GPT-6 Sol、GPT-6 Astraはmax、ClaudeはmaxにAnthropic既定のフォールバックを加えた設定、Grok 4.7はxhighです。GPT-6.1 Sol以外の5モデルは、前回記事(9月23日取得)と同じ値でした。

参考として、総合指標の値も示します。これは10評価をまとめた指数スコアで、正答率ではありません。

モデル(設定) Intelligence Index v4.3.2
Claude Opus 5.5(max) 58
Claude Fable 5.1(max) 53
GPT-6 Astra(max) 53
GPT-6.1 Sol(max) 52
GPT-6 Sol(max) 48
Grok 4.7(xhigh) 46

出典:Artificial Analysis Intelligence Index(2026年9月30日取得)。GPT-6.1 Solは、同機関の評価記事によるとGPT-6 Solから4ポイント上がり、Astraの1ポイント下に位置しています。

コーディング力:GPT-6.1 Solは上位2モデルに3ポイント差まで迫った

コーディングは、Terminal-Bench 4.0を中心に見ます。ソフトウェア開発、機械学習、運用などの66件の作業を、ターミナル上で最後までやり遂げられるかを測る評価です。すべてのテストに通った場合だけ成功と数えます。Artificial Analysisは全モデルを同じ実行環境で動かし、各作業3回の平均を公表しています。

あわせて、科学計算のコードを書くSciCodeも並べました。

モデル(設定) Terminal-Bench 4.0 SciCode
Claude Opus 5.5(max) 59.6% 66.9%
GPT-6 Astra(max) 59.1% 56.5%
GPT-6.1 Sol(max) 56.1% 54.2%
Claude Fable 5.1(max) 52.0% 63.1%
GPT-6 Sol(max) 43.9% 57.6%
Grok 4.7(xhigh) 25.8% 57.4%

出典:Artificial AnalysisのTerminal-Bench 4.0とSciCode(2026年9月30日取得)。

Terminal-Bench 4.0の正答率を比較した横棒グラフ。Claude Opus 5.5が59.6%、GPT-6 Astraが59.1%、GPT-6.1 Solが56.1%、Claude Fable 5.1が52.0%、GPT-6 Solが43.9%、Grok 4.7が25.8%

難しいターミナル作業で、12ポイント伸びた

GPT-6.1 SolのTerminal-Bench 4.0は56.1%で、GPT-6 Solの43.9%から12.2ポイント上がりました。首位のOpus 5.5とは3.5ポイント差、Astraとは3.0ポイント差です。Fable 5.1(52.0%)は追い抜きました。

Artificial Analysisは、コーディング用の別の総合指標「Coding Agent Index」でも、GPT-6.1 Solがxhigh設定でAstraを1ポイント上回り、費用は15%未満だったと報告しています。同機関の観測では、この指標に限ってはxhigh設定のほうがmax設定より3ポイント高かったそうです。思考量を最大にすれば良い、とは限らない例です。

一方、SciCodeは54.2%で、GPT-6 Solの57.6%から3.4ポイント下がりました。6モデルの最下位です。1つの関数を正確に書く力と、長い作業を最後まで進める力は別物として見たほうがよい、という前回の見立ては今回も変わりません。

OpenAIの公表値と共通環境の数値には差がある

OpenAIは、実際のコードベースで複雑な開発作業を評価するDeepSWE v1.1で、GPT-6.1 SolがAstraと同等の性能を約5分の1のコストで達成し、GPT-6 Solの最高スコアを6.4ポイント上回ったと公表しています。ただし、OpenAIの資料は競合モデルの値を公開レポートから引用したものであり、同じ環境で測った比較ではありません。

上表と読み合わせると、DeepSWEの「Astraと同等」に対し、共通環境のTerminal-Bench 4.0では3ポイント差が残っています。差の理由が作業の種類なのか実行環境なのかは、この数値だけでは確定できません。

導入時は、自分たちが実際に使う開発ツール(Claude Code、Codex、GitHub Copilotなど)で、代表的な不具合修正を同じ開始地点から解かせて比べるのが確実です。

文章・資料作成:Opus 5.5が大差の首位、GPT-6.1 SolはAstraに並んだ

文章・資料作成には、事実を整理する力、構成する力、読みやすく仕上げる力が関わります。前回と同じく、業務の成果物を評価するAA-Briefcase v1.1を、文章・資料作成に近い指標として使います。

AA-Briefcaseは、データ分析や事業戦略など4つの複数週プロジェクト、計91件のタスクで、メモ・スライド・表計算などの成果物を作らせる評価です。次の3つを組み合わせて、Eloレーティングを算出します。

  • 要件の達成:指示や資料に隠れた要件を満たし、正しい根拠で結論を出したか(合否判定の合格率)
  • 分析の質:他のモデルの成果物と比べて、分析が徹底しているか(Elo)
  • 見せ方:他のモデルの成果物と比べて、仕上がりが整っているか(Elo)
モデル(設定) 総合Elo 95%信頼区間
Claude Opus 5.5(max) 1,822 1,810–1,834
Claude Fable 5.1(max) 1,678 1,669–1,688
Grok 4.7(xhigh) 1,657 1,648–1,666
GPT-6 Astra(max) 1,569 1,559–1,580
GPT-6.1 Sol(max) 1,564 1,555–1,573
GPT-6 Sol(max) 1,483 1,473–1,493

出典:AA-Briefcaseリーダーボードと各モデルのページ(2026年9月30日取得)。Eloは相対評価であり、正答率や満点に対する達成率ではありません。

AA-Briefcase v1.1のEloと95%信頼区間を比較した横棒グラフ。Claude Opus 5.5が1,822、Claude Fable 5.1が1,678、Grok 4.7が1,657、GPT-6 Astraが1,569、GPT-6.1 Solが1,564、GPT-6 Solが1,483

内訳:GPT-6.1 Solは分析の質で伸び、見せ方は下がった

モデル(設定) 分析の質(Elo) 見せ方(Elo) 要件の合格率
Claude Opus 5.5(max) 2,207 1,710 61.2%
Claude Fable 5.1(max) 1,999 1,486 61.5%
Grok 4.7(xhigh) 1,994 1,499 55.4%
GPT-6.1 Sol(max) 1,807 1,438 55.7%
GPT-6 Astra(max) 1,777 1,535 52.0%
GPT-6 Sol(max) 1,652 1,473 46.9%

分析の質と見せ方は、それぞれ独立したEloです。総合Eloの内訳として足し引きできる値ではありません。

GPT-6.1 Solの総合Eloは1,564で、GPT-6 Solから81点上がり、Astra(1,569)と信頼区間が重なる水準に並びました。伸びたのは分析の質(1,652→1,807)と要件の合格率(46.9%→55.7%)です。要件の合格率はAstraを上回り、Grok 4.7とほぼ同じになりました。

一方、見せ方は1,473から1,438へ下がり、6モデルの最下位です。Artificial Analysisも、6.1の改善は分析の質と要件達成が牽引し、見せ方はわずかに下がったと説明しています。スライドや報告書の体裁まで任せたい用途では、この点を確かめる必要があります。

Opus 5.5との差は、依然として大きい

Opus 5.5は総合Eloで2位のFable 5.1を144点、GPT-6.1 Solを258点上回ります。分析の質と見せ方の両方で先頭で、総合Eloの信頼区間も重なりません。前回記事で確認した「文章・資料作成はOpus 5.5」という位置づけは、今回も変わりませんでした。

Fable 5.1(1,678)とGrok 4.7(1,657)も、GPT-6.1 Solをそれぞれ114点・93点上回っています。GPT-6.1 Solは費用が大幅に低い分、「下書きを大量に作り、仕上げは上位モデルか人が行う」という分担なら有力です。ただし、成果物をそのまま提出する用途で、Opus 5.5やFable 5.1の代わりになるとまでは、今回の数値からは言えません。

長いPDFを読んで専門的な作業をこなす力では、Opus 5.5を上回りAstraに並んだ

OpenAIは今回、Claude Opus 5.5を名指しで比較しています。使った評価の1つがGDP.pdfです。金融、医療、法務など10分野・計4,592ページのPDFを使う100件の専門作業で、1,275個ある細かな採点項目のうち、その作業の項目をすべて満たせた割合を見ます。

モデル(設定) GDP.pdf(全項目合格率)
GPT-6 Astra(max) 31.0%
GPT-6.1 Sol(max) 31.0%
Claude Opus 5.5(max) 26.2%
Claude Fable 5.1(max) 26.2%
GPT-6 Sol(max) 24.8%
Grok 4.7(xhigh) 20.0%

出典:Artificial AnalysisのGDP.pdf(2026年9月30日取得)。思考設定によって値が変わり、GPT-6.1 Solはhighで32.0%、xhighで31.8%、GPT-6 Astraはxhighで32.2%です。

共通環境の数値でも、GPT-6.1 SolはOpus 5.5を4.8ポイント上回り、max設定同士ではAstraと同率でした。OpenAIの「テストした推論設定のいずれでも、Opus 5.5より高いスコアを半分未満のタスクあたりコストで達成した」という主張は、独立評価とも整合します。

ただし、最上位でも採点項目をすべて満たせたのは3割ほどです。契約書や報告書のように1か所の見落としが問題になる作業では、どのモデルを選んでも人の確認を前提にする必要があります。また、この評価は英語の資料を使っています。日本語の契約書や議事録を正しく読めるかは測られていません。

各社が主張する「事実の正確さ」

OpenAIは、難しいプロンプトに対する事実誤認率を社内で評価し、xhigh設定でGPT-6 Solの4.5%から4.1%へ下がり、同じ設定のAstra(4.0%)に近づいたと説明しています。これは以前のモデルの誤りをユーザーが指摘した会話から作った意図的に難しい評価で、通常の利用を代表するものではないと同社も注記しています。

Anthropicが前回、Opus 5.5について「1つでも捏造があれば不合格」という品質基準を掲げたのと同様に、各社が事実への忠実さを改善対象として打ち出す流れが続いています。いずれも社内評価であり、独立した評価ではない点は変わりません。

日本語の文章は、自分たちの原稿で比べる

AA-Briefcaseを含め、今回の評価は日本語の文章の自然さを測っていません。日本語で書かせる用途では、同じ資料を渡し、モデル名を伏せて読み比べる方法をおすすめします。比べる観点(事実への忠実さ、構成、自然な日本語、語調、修正への対応)は、GPT-6 Astra比較記事の比較表にまとめています。

価格:単価は据え置き、1タスクの実費は6モデルで最も低い

API単価とCopilotのクレジット

6モデルはすべてGitHub Copilotで一般提供されています。Copilotの利用料はGitHub AI Creditsで計算され、1クレジットは0.01ドルです。今回の6モデルでは、入力・出力の単価が各社APIと同じでした。

下表は、100万トークンあたりの単価をクレジットで示したものです。100で割ると米ドルになり、GPT-6.1 Solなら入力2ドル・出力10ドルです。

モデル 入力 キャッシュ読み取り キャッシュ書き込み 出力
GPT-6.1 Sol 200 10 250 1,000
GPT-6 Sol 200 20 250 1,000
GPT-6 Astra 1,000 100 1,250 5,000
Claude Opus 5.5 400 20 500 2,000
Claude Fable 5.1 1,000 25 1,250 5,000
Grok 4.7 200 50 – 600

出典:Copilotのモデル別料金、Copilotの対応モデル(2026年9月30日取得)。Grok 4.7にはキャッシュ書き込みの料金項目がありません。

使えるプランはGPT-6 Solと同じです。GPT-6.1 SolはProでは使えず、Pro+・Max・Business・Enterpriseが対象です。6モデルのうちProで使えるのはGrok 4.7だけです。

表に書ききれない条件もあります。

  • 長文料金:GPT-6.1 Solを含むGPT-6の3モデルは、入力が27万2,000トークンを超えると、リクエスト全体で入力とキャッシュが2倍、出力が1.5倍になります。Grok 4.7は入力が20万トークンを超えると、入力・キャッシュ・出力とも2倍です。
  • キャッシュ書き込み:AnthropicとOpenAIのモデルは、キャッシュへの書き込みに入力単価の1.25倍がかかります。
  • Ultrafast版:GPT-6.1 Sol Ultrafastは、APIのほか、ChatGPTのProに新設された月額500ドルの上位ティア(利用上限が最も高いプラン)で使えます。標準版とは別料金です。

試算:同じトークン量なら何クレジットか

前回と同じ条件で計算します。Copilot Pro+は月39ドルで、毎月7,000クレジットが含まれます(Copilotプラン比較)。新規の入力3万トークン、キャッシュ読み取り12万トークン、出力8,000トークンの1回の依頼です。キャッシュ書き込みはなく、長文料金の対象外という前提です。

モデル 1回あたりのクレジット Pro+の月7,000クレジットで使える回数
GPT-6.1 Sol 15.2 460回
GPT-6 Sol 16.4 426回
Grok 4.7 16.8 416回
Claude Opus 5.5 30.4 230回
Claude Fable 5.1 73 95回
GPT-6 Astra 82 85回

これは単価表から計算した例で、実測ではありません。回数は端数を切り捨てています。GPT-6.1 Solなら、入力3万×200+キャッシュ12万×10+出力8,000×1,000を100万で割って、15.2クレジットになります。GPT-6 Solとの差はキャッシュ読み取り分の1.2クレジットだけです。

実際の費用は、モデルが使うトークン量で決まる

上の試算は、どのモデルも同じトークン数を使う前提です。実際には、同じ仕事でも、モデルが考えたり試したりする量が大きく違います。

Artificial Analysisは、総合評価を実行したときの1タスクあたりの平均費用を公表しています。

モデル(設定) 1タスクあたりの費用 1タスクあたりの出力トークン
Claude Fable 5.1(max) $7.63 約7.8万
Claude Opus 5.5(max) $5.98 約11.9万
Grok 4.7(xhigh) $3.74 約8.1万
GPT-6 Astra(max) $3.26 約2.7万
GPT-6 Sol(max) $1.05 約3.1万
GPT-6.1 Sol(max) $0.72 約3.8万

出典:Artificial Analysisの各モデルのページと評価記事(2026年9月30日取得)。キャッシュの利用を含むIntelligence Index v4.3.2の実行費用です。

総合評価の1タスクあたりの実行費用を比較した横棒グラフ。Claude Fable 5.1が7.63ドル、Claude Opus 5.5が5.98ドル、Grok 4.7が3.74ドル、GPT-6 Astraが3.26ドル、GPT-6 Solが1.05ドル、GPT-6.1 Solが0.72ドル

GPT-6.1 Solの1タスクあたり費用は0.72ドルで、Astra(3.26ドル)の4分の1以下、Opus 5.5(5.98ドル)の8分の1です。出力トークンはGPT-6 Solより約2割多いのに、費用は31%下がりました。1タスクあたりの入力側の費用が0.74ドルから0.34ドルへ半分以下になっており、キャッシュ読み取りの値下げが主因とみられます(入力トークン量の違いも影響し得ます)。

思考設定を下げると、さらに安くなります。Artificial Analysisの取得値では、GPT-6.1 Solは総合指標がxhighで51、highで50、mediumで48で、1タスクの費用はそれぞれ0.39ドル、0.32ドル、0.21ドルです。mediumでもGPT-6 Solのmax(48)と同じ総合指標を、5分の1の費用で出しています。

ただし、思考設定を下げると文章・資料作成の評価は大きく落ちます。AA-Briefcaseの総合Eloは、maxの1,564に対し、xhighで1,507、highで1,471、mediumで1,365です。コーディングや読解では下げやすく、成果物を作る用途では下げにくい、と覚えておくとよいでしょう。

比較するなら、次の形で記録すると実態に近づきます。

完成までの総コスト = 全試行のクレジット(API料金)+ 人が確認・修正する時間の費用

前回の比較から何が変わったか

前回(9月23日)の比較からの主な変化は、次の3つです。

  1. Sol系の位置づけが変わった:「低価格で長文読解向き」から、「上位2モデルに3ポイント差のコーディング力を、最も低い費用で」へ。同じ単価のまま、GPT-6.1 Solに置き換わりました。
  2. PDFを読んで答える専門作業で、OpenAIの中位モデルがAnthropicの上位2モデル(Opus 5.5・Fable 5.1)を上回った:GDP.pdfでGPT-6.1 SolがOpus 5.5を4.8ポイント上回り、Astraと並びました。
  3. 文章・資料作成の序列は変わらなかった:Opus 5.5、Fable 5.1、Grok 4.7の上位3モデルは動かず、GPT-6.1 SolはAstraと同水準に上がったにとどまります。

Artificial Analysisの総合指標は、前回と同じv4.3.2です。今回は6モデルとも同じ版の点数を比べています。

まとめ:「Astra級を5分の1で」は、仕事によって当たりと外れがある

6モデルの公開評価から、仕事ごとの最初の候補は次のように整理できます。

  • 難しい実装やターミナル作業:Opus 5.5とAstra。費用を抑えるならGPT-6.1 Solが3ポイント差で続く
  • 開発作業を大量に回す:GPT-6.1 Sol。思考設定はxhighやhighも試す
  • 長いPDFでの厳密な作業:GPT-6.1 SolとAstra。どのモデルでも人の確認を前提にする
  • 提案書・報告書などの成果物:Opus 5.5。品質で次点はFable 5.1、費用を抑えるならGrok 4.7も比べる
  • 下書きの量産と仕上げの分担:下書きはGPT-6.1 Sol、仕上げは上位モデルか人

OpenAIの「Astraに迫る性能を5分の1の価格で」という説明は、コーディングと、PDFを読んで答える専門作業(GDP.pdf)では独立評価とも整合しました。一方、文章・資料作成では、Astraに並んだだけで、Claudeの2モデルとGrok 4.7には届いていません。モデル1つで全部をまかなうより、仕事ごとに候補を分ける考え方は、今回も有効です。

フィールフロウのAI仕様駆動開発の視点では、モデル選びの前に、任せる作業と完了条件を決めたいと考えています。

  • コードなら、対象の不具合が解消し、既存機能を壊さず、レビューを通せること。
  • 文書なら、出典に忠実で、読者が理解でき、指定した語調へ整っていること。
  • どちらも、クレジットの消費量と人の確認時間を含めて、完成までを比較すること。

7日で後継が出る速さは、これからも続くでしょう。公開評価で候補を絞り、自分たちの代表的な仕事で確かめる。この手順を持っておけば、次のモデルが出たときも落ち着いて判断できます。

関連記事