論文レポート生成AIGDPvalベンチマーク

専門家の成果物と「同等以上」は何割か — 44職種1,320タスク GDPval が示す実務委任ライン

OpenAIのGDPvalは、44職種の専門家が作った実務タスクで、AIの成果物を専門家の成果物と比べる評価です。2025年9月の論文では、最良モデルでも専門家と同等以上は47.6%。その後半年ほどで80%台の自社公表値が並びました。数字の意味と限界を整理し、どの業務をどこまで任せるかの線引きに使います。

分析
岡崎 太
CTO / AIアーキテクト
公開日
読了時間
5分で読めます
Share

Key Findings

  • GDPvalは9セクター・44職種の専門家(平均14年の経験)が作った1,320タスクの評価。公開された代表220タスクで、成果物どうしを専門家が盲検比較する
  • 2025年9月の論文では、Claude Opus 4.1の成果物が専門家と同等以上と評価された割合は47.6%。残りの半数超は専門家の成果物が選ばれた
  • 2026年4月のOpenAI発表ではGPT-5.5が84.9%。ただし同社の自社公表で、専門家評価か自動評価かの明記が薄く、公式リーダーボードは停止した
  • 負け方の主因は指示への不従と体裁。推論だけなら約100倍速いが、専門家のレビューを含めるとGPT-5で1.4倍程度に縮む

サマリ

「AIの成果物は専門家と同じ水準か」。この問いに、職種ごとの実務タスクで答えようとしたのがOpenAIのGDPvalです。

2025年9月の論文では、当時の最良モデルであるClaude Opus 4.1の成果物が、専門家の成果物と同等以上と評価された割合は47.6%でした。裏返せば、半数超のタスクでは専門家の成果物が選ばれています。その後、OpenAIの自社発表では2026年4月のGPT-5.5で84.9%まで上がりました。

数字が動いた半年ほどで、どの業務をどこまでAIに任せるかの線引きも動いています。ただし、評価の条件を読まずに数字だけ移すと、線を引く場所を誤ります。本稿は、GDPvalが測っているものと測っていないものを整理し、8月に扱った推論コストの低下と合わせて、実務委任の判断に使える形に落とします。

論文の整理:何を、誰が、どう評価したのか

44職種の専門家が作った実務タスク

GDPvalは、米国GDPへの寄与が5%を超える9セクターから、賃金総額の大きい5職種ずつ(小売のみ4職種)、計44職種を選んでいます。ソフトウェア開発者、看護師、弁護士など、パソコンで行う知識労働が対象です。

項目 論文で確認できる内容
タスク数 全体1,320(職種あたり30)、公開された代表セット220(職種あたり5)
タスク作成者 各職種の専門家。4年以上の実務経験が条件で、平均14年
成果物 文書、スライド、表計算、図面、動画など。実際の業務に近い形式
評価方法 専門家が、どちらが作ったか知らされずにAIと人の成果物を比較。勝ち・引き分け・負けで採点
比較対象モデル GPT-4o、o3、GPT-5、Claude Opus 4.1、Gemini 2.5 Pro、Grok 4など

出典は論文§2と§A.6です。代表セットでは、各タスクにつきモデルの出力を3回生成し、3名の専門家がそれぞれ比較しています。1回の比較に1時間超をかけたと論文は記しています。

同等以上は半数弱、負け方の主因は指示と体裁

代表セットで、Claude Opus 4.1の成果物が専門家より良い、または同等と評価された割合は47.6%でした(§3.1、Figure 5)。論文は、モデル性能がGDPval上でおおむね直線的に改善していることも示しています。

専門家が人の成果物を選んだ理由で最も多かったのは、指示に完全には従っていないことでした(Figure 8)。GPT-5については体裁の誤りが主因で、指示への不従は最も少なかったと論文は述べています。知識の誤りが主因だとは書かれていません。

GPT-5の失敗を専門家が重さで分類した結果では、最も多いのは「受け入れ可能だが水準未満」で、「悪い、または致命的」が約29%、そのうち致命的は約3%でした(Figure 14)。人が確認する前提なら回収できる失敗が多い、と読めます。

「100倍速い」は、レビューを含まない

OpenAIの公式ページは、フロンティアモデルがGDPvalのタスクを専門家より約100倍速く、約100倍安く完了できるとしています。ただし同じページで、これは純粋な推論時間とAPI料金であり、人による監督、反復、業務への統合を含まないと断っています。

論文のTable 2は、専門家がレビューして必要なら再試行する現実的な手順で試算し直しています。この条件では、GPT-5の改善幅は速度で1.39倍、コストで1.63倍にとどまります。GPT-4oでは速度が人の0.46倍と、人より遅くなります。短いタスク(0〜2時間)ほど勝率が高く、長いタスクほど下がる傾向も示されています(Figure 13)。

2026年の数字をどう読むか

論文の公開後、OpenAIは新モデルの発表ごとにGDPvalの値を掲載しています。

専門家の成果物と同等以上と評価された割合(wins or ties)

2025年9月の論文と、OpenAIの各モデル発表ページに掲載された値です。

  • GPT-52025年12月のGPT-5.2発表ページの比較表
    38.8%
  • Claude Opus 4.12025年9月の論文§3.1。専門家評価
    47.6%
  • GPT-5.2 Thinking2025年12月のGPT-5.2発表ページ。専門家評価
    70.9%
  • Claude Opus 4.72026年4月のGPT-5.5発表ページ
    80.3%
  • GPT-5.52026年4月のGPT-5.5発表ページ
    84.9%

出典:Patwardhanら(2025)、OpenAI「Introducing GPT-5.2」「Introducing GPT-5.5」。同じ指標名でも掲載ページが異なり、論文Table 2ではGPT-5は39.0%です。2026年の値は採点者が専門家か自動評価かの明記がありません。GDPvalは米国の知識労働タスクの評価であり、御社の業務でAIが勝つ割合ではありません。

この推移には、3つの但し書きが要ります。

第1に、いずれもOpenAIの自社公表です。論文とGPT-5.2の発表は専門家評価と明記していますが、GPT-5.4以降は採点者の種別が本文で確認できませんでした。第2に、OpenAIが運営していた公式リーダーボードは停止し、第三者のArtificial Analysisによる「GDPval-AA」へ誘導されています。こちらはLLMによる自動審査で、Elo形式です。論文の自動評価器は専門家との一致率が66%で、専門家どうしの71%を下回っており、自動評価の値は専門家評価の割合と同列に扱えません。第3に、論文自身がLimitationsで、タスクは指示が明確な一回限りで対話がなく、実務では前提を集めること自体に労力がかかると述べています。

岡崎の分析

委任ラインは「勝率」ではなく「負け方」で引く

私たちがGDPvalから受け取るのは、モデルの勝率そのものより、負け方の分布です。

専門家が人の成果物を選んだ主因が、指示への不従と体裁であるなら、対策はモデルの変更だけではありません。依頼の条件を書き切ること、成果物の形式を先に決めること、確認の観点を固定することで、同じモデルでも採用できる割合は変わります。GDPvalのタスクは専門家が指示を書き切った状態で評価されており、実務ではその前段が業務の一部です。

失敗の約3%が致命的だったという数字も、委任の線を引く材料です。人が確認する工程を残す限り回収できる失敗が多い一方で、確認なしに出す業務では、致命的な誤りが起きたときの影響で線を引く必要があります。金額の大きい契約書や、患者への説明のように影響が戻せない業務は、勝率が高くても人の確認を外す理由にはなりません。

8月の推論コスト記事と、つないで読む

8月に扱った推論価格の低下では、価格が年率中央値で50分の1になった時代に、見送った案件を再評価する話をしました。GDPvalの「レビュー込みで1.4倍」は、その再評価に使える換算です。

推論が100倍安くても、専門家のレビューを含めた実務のコストは1倍台に縮む。つまり、AI導入で得られるのは「速く安い試行を何度も回せる」ことであって、「専門家がいらなくなる」ことではありません。私たちは、この試行の回数を増やせる業務から委任を始めることを提案しています。提案書の構成案、分析の切り口、コードの叩き台のように、複数案を出して人が選ぶ業務です。

提言 — どう付き合っていくか

実務委任ラインの引き方

フィールフロウの実践案です。順序そのものを論文が検証したものではありません。

  1. 業務を成果物の単位に分ける職種名ではなく、文書・表・図面などの成果物ごとに分ける。指示を書き切れる業務から候補にする。
  2. 自社の成果物で盲検比較するAIと担当者の成果物を、作者を伏せて評価者が比べる。勝率と一緒に、負けた理由を指示・体裁・内容で分類する。
  3. 確認を残す業務と外す業務を分ける誤りが戻せない業務は勝率にかかわらず人の確認を残す。試行回数が価値になる業務から委任を広げる。

勝率は線を引く材料の1つ。負け方と、誤ったときの影響で、任せる範囲を決める。

9月の岡崎レーンは、任せたい業務と任せられる業務のズレ、開発組織の7条件、エージェントの安全性を扱ってきました。本稿の委任ラインは、その締めくくりです。数字はモデルの更新で動きますが、成果物の単位で測り、負け方で線を引く手順は変わりません。

フィールフロウでは、御社の成果物でAIと担当者を比べる検証の設計や、確認工程を残す業務の切り分けについてご相談いただけます。まず、委任を検討している業務の成果物を1つお持ちください。実務委任ラインの設計について相談する

出典・参照データ

本レポートの分析は以下の一次情報に基づいています。統計・数値の詳細は各出典をご確認ください。

  1. GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks(arXiv:2510.04374)
    Patwardhanほか / OpenAI

    §2の設計と専門家の経験年数、§3.1の47.6%、Table 2のレビュー込み速度・コスト、Figure 8・14の失敗分類、§2.5の評価者一致率、Limitations。2026年9月20日時点でv1のみ

  2. Measuring the performance of our models on real-world tasks
    OpenAI

    「専門家より約100倍速く、約100倍安い」が純粋な推論時間とAPI料金に基づき、人のレビューや統合を含まないとの但し書き、44職種の一覧、BLS・O*NETによる職種選定を参照

  3. Introducing GPT-5.2
    OpenAI

    比較表のGDPval(wins or ties):GPT-5.2 Thinking 70.9%、GPT-5 38.8%。専門家による評価と明記。同ページ本文は70.7%と表記が揺れる。2026年9月20日確認

  4. Introducing GPT-5.5
    OpenAI

    GDPval(wins or ties):GPT-5.5 84.9%、GPT-5.4 83.0%、Claude Opus 4.7 80.3%、Gemini 3.1 Pro 67.3%。採点者の種別は本文に明記なし。2026年9月20日確認

  5. GDPval-AA
    Artificial Analysis

    OpenAIのリーダーボード停止後に参照される第三者評価。220タスクをLLMが自動審査しEloで表示する方式であり、専門家評価の割合とは別の指標である点を参照。2026年9月20日確認