論文レポート生成AIAIエージェント業務改善

任せたい業務と、AIができる業務は違う — WORKBankで考える導入順序

AIで実行できそうでも、現場が任せたいとは限りません。StanfordのWORKBankは、米国の1,500人・104職種・844タスクを対象に、働く人の希望と専門家の能力評価を照合しました。自動化希望と技術的な見込みを分け、導入順序と人が担う範囲を決める方法を整理します。

分析
岡崎 太
CTO / AIアーキテクト
公開日
読了時間
4分で読めます
Share

Key Findings

  • WORKBankは米国の1,500人の回答と52人のAI専門家の評価を、104職種・844タスクで照合した研究。能力は専門家評価であり、現場での実行成功率ではない
  • 自動化に肯定的なタスクは46.1%。人数や労働時間、削減可能な人員の割合ではない
  • 自動化希望と能力評価の4象限で候補を分け、人が関与する範囲は別に設計する
  • 日本企業への提言は、自社の担当者への聞き取りと実データでの検証から導入順序を決めること

サマリ

AI導入の候補を選ぶとき、「技術的にできるか」だけでは順序を決められません。毎日その仕事をしている人が、どこを任せたいのか。その希望と実行可能性を分けて確かめる必要があります。

StanfordのShaoらによるWORKBank研究は、この違いを仕事全体ではなくタスク単位で整理しました。自動化への希望が高く、能力評価も高い業務から検証を始める。これが本稿で提案する入口です。ただし、専門家が可能と見込むことと、御社の業務を安全に任せられることは別です。

論文の整理:何を調べた研究か

WORKBank原論文(2025年6月公開のv1)は、米国の職務データベースO*NETを基に、働く人の希望とAI専門家の評価を対応させています。調査設計は次のとおりです。

項目 原論文で確認できる内容
データ収集期間 2025年1〜5月
働く人の回答 米国の1,500人、104職種
対象タスク 844タスク
技術側の評価 52人のAI専門家による評価
比較するもの 自動化への希望、技術的な能力の見込み、人の関与の程度

出典はWORKBank原論文§1・§2・Limitationsです。回答者は業務への希望を答え、専門家は当時のAIシステムへの知識に基づいて評価しています。全タスクをAIに実行させ、合否を測った試験ではありません。

46.1%は「人の割合」ではない

原論文§3.1とStanford公式解説によると、自動化への希望が肯定的だったタスクは46.1%でした。公式解説は、希望を5段階で尋ね、タスクごとの平均評価が3を上回る場合を肯定的と説明しています。

自動化に肯定的なタスクの割合

WORKBankの844タスクを対象とした、働く人の希望の集計です。

  • 自動化への希望が肯定的なタスク5段階の希望評価の平均が3を上回るタスク
    46.1%

出典:Shaoら(2025)§3.1、Stanford SALT Lab公式解説。人数・労働時間・実行成功率の割合ではありません。残りすべてが自動化への反対を意味するわけでもありません。

この数字を「仕事の半分をなくせる」と読み替えることはできません。タスクごとの所要時間は同じではなく、自動化を望むことも、実際に任せられることも、雇用の削減を意味しないからです。

希望と能力評価を4象限に分ける

原論文§3.2は、希望と能力評価の高低から4領域を設けています。右端は研究結果そのものではなく、私たちが導入判断へ置き換えた提案です。

現場の希望 能力評価 論文の領域 自社での次の行動案
高い 高い Green Light 実データで試し、例外対応と確認負担を測る
低い 高い Red Light 任せたくない理由を聞き、補助用途を検討する
高い 低い R&D Opportunity 対象範囲を狭め、研究・試作の候補として扱う
低い 低い Low Priority 導入を急がず、業務上の必要性から見直す

Green Lightという名称も、本番稼働の安全性を保証する認証ではありません。現場での試行対象を探すための分類です。

任せたい範囲まで合意する

WORKBankは、人がどの程度関与するかをHuman Agency Scale(HAS)でも整理しています。Stanford公式解説では、H1の人が関与しない状態から、H5の人の関与が不可欠な状態までを区別しています。

自動化への賛否だけを聞くと、「下書きなら任せたいが、送信は自分が判断したい」という希望を取りこぼします。導入前に確認すべきなのは、AIを使うかどうかに加えて、誰が確認し、誰が最終判断をするかです。

日本の現在に、そのまま当てはめない

原論文のLimitationsは、既存の職務定義では新しい仕事を捉えきれないこと、回答者のAIへの理解や雇用への不安が回答に影響しうること、対象職種が限られることを挙げています。技術評価も調査時点のものです。

したがって、ここで示した割合は2026年の日本企業の導入率や、最新モデルの能力を示しません。本稿では原論文v1の調査結果を、御社で問いを立てるために使います。

岡崎の分析

私たちは、AI導入の順序を決めるうえで、現場が減らしたい負担と、確認に残る負担を一緒に見ることが重要だと考えています。

たとえば、問い合わせ対応の担当者が困っているのは、文章を書くことより、古い資料から回答根拠を探すことかもしれません。その場合、回答を自動送信する仕組みより、根拠の候補と該当箇所を示す仕組みのほうが希望に合う可能性があります。これは研究の実例ではなく、判断方法を示す仮想例です。

また、同じ業務名でも任せ方を分けられます。受注メールなら、必要項目の抽出、台帳への転記、欠落項目の確認、顧客への返信で、誤りの影響も担当者の希望も変わります。業務を丸ごと自動化する予算を決める前に、どの工程の負担を減らすかを合意すると、検証対象が明確になります。

業務別のAI投資回収を考えたレポートと合わせるなら、候補業務の効果を見積もる手前に、この希望と能力の確認を置くのが私たちの提案です。

提言 — どう付き合っていくか

自社の導入候補を決める手順

WORKBankの観点を用いたフィールフロウの提案です。研究で効果が実証された導入手順ではありません。

  1. 担当者に聞く減らしたい作業、残したい判断、任せたくない理由を具体的な工程で聞く。
  2. 同じ条件で試す実際の入力と例外を使い、精度だけでなく確認・修正にかかる時間も記録する。
  3. 任せる範囲を決めるAIの担当、人の承認、失敗時の戻し方を決めてから対象を広げる。

技術の見込みと現場の希望が重なる工程から、責任を持てる範囲で始める。

最初の検証では、処理時間、確認と修正にかかった時間、見逃した誤り、担当者が継続利用したいかを記録してください。確認の負担が大きい場合は、自動化の範囲を狭めます。十分な精度でも希望が低い場合は、その理由を検討し、説明だけで押し切らないことが大切です。

御社の業務をどこまで分ければよいか、何を試行対象にすべきか迷う場合は、フィールフロウへご相談ください。現場の希望、データの状態、確認責任を整理し、導入順序を一緒に検討します。

出典・参照データ

本レポートの分析は以下の一次情報に基づいています。統計・数値の詳細は各出典をご確認ください。

  1. Future of Work with AI Agents: Auditing Automation and Augmentation Potential across the U.S. Workforce(v1)
    Yijia Shaoほか / Stanford University

    §2の調査設計、§3.1の46.1%、§3.2の4領域、§3.3の人の関与、Limitations。2025年1〜5月収集の米国調査で、実行性能のベンチマークではない

  2. Future of Work with AI Agents — 2025 Audit
    Stanford SALT Lab

    調査規模、5段階の自動化希望の定義、Human Agency Scaleの解説を照合