論文レポート生成AIチーム設計フィールド実験

AI付きの1人はチーム1組に届くか — P&G 776名フィールド実験「Cybernetic Teammate」

要旨でP&Gの社員776名と報告された実験を、個人とチーム、AIの有無の4条件で読み解きます。AIを使った個人の成果物は、AIなしの2人チームと同程度の品質でした。一方、上位10%の解を出す確率はAI付きチームだけが有意に上がりました。平均を取るか、卓越を取るか。チーム編成の判断材料を整理します。

分析
岡崎 太
CTO / AIアーキテクト
公開日
読了時間
6分で読めます
Share

Key Findings

  • 2024年5〜7月のP&G社内ワークショップ。要旨では776名と報告。個人/チーム×AIあり/なしの4条件を比較し、22名の専門家が成果物を盲検評価した
  • 品質はAIなしチーム+0.24SD、AI付き個人+0.37SD、AI付きチーム+0.39SD。AI付き個人はAIなしチームと同等の水準に達した
  • 上位10%に入る確率は、AI付きチームだけが有意に上昇(対照群5.8%に対し+9.2ポイント)。平均と卓越では、効く編成が違う
  • 1日限りの実験で、異職能2人ペアのみが対象。定常業務や大規模チームへの当てはめは論文の射程外

サマリ

「AIを使えば1人でチームの仕事ができる」。この言い方は、半分だけ正しいと私たちは見ています。

要旨でP&Gの社員776名と報告されたフィールド実験「The Cybernetic Teammate」(NBER Working Paper 33641、2025年4月版)では、AIを使った個人の成果物は、AIを使わない2人チームと同程度の品質でした。ただし、上位10%に入る優れた解を出す確率が有意に上がったのは、AIを使ったチームだけです。

この実験では、AI付きの個人がAIなしチームと同程度の品質に達し、上位10%の解を出す確率が対照群より有意に高かったのはAI付きチームだけでした。ただし、有意でなかった条件に効果がないことや、突出した成果にチームとAIが必須であることまで示した結果ではありません。本稿では実験の条件と限界を整理し、チーム編成を考える判断軸に落とします。

論文の整理:何を、どう比べたのか

4条件のランダム化比較

Dell’Acqua(Harvard Business School)、Mollick(Wharton)らとP&Gの社員による共同研究です。2024年5〜7月に、P&Gの4事業部(ベビーケア、フェミニンケア、グルーミング、オーラルケア)の社員を対象に、1日のオンライン製品開発ワークショップを実施しました。課題は各事業部が実際に抱える新製品開発のテーマです。

条件 人数 内容
対照群(個人・AIなし) 154名 1人で解決策を作る
チーム・AIなし 115組230名 商業系1名と研究開発系1名のペア
個人・AIあり 155名 1人でGPT-4を使う
チーム・AIあり 126組252名 同じペア構成でGPT-4を使う

出典はNBER版のTable 1と§3です。なお、Table 1の条件別人数の合計は791名で、同じ版の要旨と§3に記載された776名とは一致しません。理由は確認できていません。本稿のタイトル・アイキャッチの「776名」は要旨の表記に基づき、表の人数はTable 1をそのまま記載しています。

AI条件の参加者は1時間のプロンプト研修を受け、Azure経由のGPT-4(7月回のみGPT-4o)を使いました。成果物は22名の専門家が条件を知らされずに1〜10点で評価し、対照群を基準に標準偏差(SD)単位へそろえています。

品質:AI付き個人はAIなしチームと同等

AIなしのチームは+0.24SD、AI付きの個人は+0.37SD、AI付きのチームは+0.39SDでした(Table 2、いずれも対照群比)。論文は、AIを使う個人が「AIなしのチームと同等の水準に達した」と述べ、品質分布の形も似ていたと報告しています(Figure 3)。

一方、AI付きチームとAI付き個人の差、AI付きチームとAIなしチームの差は、平均品質では統計的に有意ではありませんでした。平均だけを見ると、AIを渡した時点で個人とチームの差が縮まるということです。

時間は、AI付きの個人が対照群より16.4%短く、AI付きのチームは12.7%短くなりました(§5.1)。同時に成果物の分量は、対照群の平均381語に対しAI付き個人で+504語、AI付きチームで+544語と、大きく増えています(Table 3)。短い時間で、長く詳細な解答が出たと読めます。

上位10%:チームにAIを足したときだけ上がる

平均ではなく、突出した解が出る確率はどうか。専門家評価で上位10%に入った割合は、対照群で5.8%でした。AI付きチームでは+9.2ポイントと有意に上昇し、論文はこれを「約3倍」と表現しています(Table 10、§6.1)。AI付き個人は+1.9ポイント、AIなしチームは+3.7ポイントで、いずれも有意ではありません。

専門家評価で上位10%に入った成果物の割合

NBER Working Paper 33641のTable 10。対照群の平均に、有意だった条件の差分を足して示しています。

  • 対照群(個人・AIなし)基準となる平均
    5.8%
  • チーム・AIあり対照群+9.2ポイント。p<0.05
    15.0%

出典:Dell'Acquaら(2025)Table 10、§6.1。チーム・AIありの値は対照群5.8%に係数9.2ポイントを足した推定値です。AI付き個人(+1.9ポイント)とAIなしチーム(+3.7ポイント)は有意でないため図に載せていません。AIを使えば必ず3倍になるという予測値ではありません。

専門領域の壁と、感情の変化

この実験のチームは、商業系と研究開発系の異なる職能のペアです。AIなしでは、商業系は商業寄り、研究開発系は技術寄りの解に偏りました。AIを使うと、この職能による偏りが個人でも見られなくなりました(Figure 6)。チームでも、片方の視点が支配する二峰性が弱まっています(二峰性係数0.564から0.482、Figure 11)。

論文は「バランスの取れた解が何%になった」という割合を示していないため、本稿でも数値化しません。示されているのは分布の形の変化です。

感情面では、AIを使った個人のポジティブ感情が+0.46SD、AI付きチームが+0.64SD上がり、ネガティブ感情はそれぞれ約0.23SD下がりました(Table 6、Table 7)。AIを使った個人の感情は、AIなしのチームで働いた人と同等以上だったと論文は述べています。

論文が明示する限界

論文§7は、2つの注意点と2つの限界を挙げています。参加者はプロンプトに不慣れで、AIツールも協働用に最適化されていないため、効果は下限の可能性がある。一方で、1日限りのオンライン協働であり、日常の調整や反復作業は捉えていない。対象は異職能の2人ペアだけで、同職能や大人数のチームは検証していない、という内容です。

2026年6月にはOrganization Science誌に査読版が掲載され、分析対象を791名と記載しています。要旨には、AIはアイデア生成の質を高め、選別では人の判断が価値を保つという知見が加わりました。本稿の数値は2025年4月のNBER版に基づき、掲載版の本文数値は照合していません。

岡崎の分析

「1人でチーム分」は、平均の話

私たちがこの論文を読んで注意したいのは、平均品質と、突出した成果は別の指標だという点です。

日常業務の多くは、期日までに一定水準の成果物を出す仕事です。この種の業務では、AIを使った個人がAIなしの2人チームに並んだという結果は、会議や調整の時間を減らせる可能性を示しています。一方、新規事業の企画や、競合と差がつく提案のように上位の解が必要な場面では、AIを渡した個人だけでは有意な改善が出ていません。効いたのは、異なる職能の人が2人いて、そこにAIが加わった構成です。

経営の判断としては、「AIで人数を減らす」と「AIで成果の天井を上げる」は、別の投資だと分けて考える必要があります。論文自身も、効率を取るか卓越を取るかという問いを残しています。P&Gが注目したのは後者だと脚注にあります。

不慣れな人ほど、AIの底上げが大きい

もう1つ見落としやすいのが、職務との距離です。製品開発が本来の職務でない参加者の成果物(218件)では、AIなしでチームを組んでも品質は+0.02SDとほぼ変わりませんでしたが、AIを使った個人は+0.32SDでした(Table 5)。論文は、本来の職務でない人がAIを使って1人で作った成果物が、本職の人を含むチームと同等の水準だったと述べています。

私たちは、これを「専門外の人にも任せられる範囲が広がる」と読む一方で、誰が最終判断をするかは別に決める必要があると見ています。査読版の要旨にある「選別は人の判断が価値を保つ」という知見も、この点と整合します。AIが増やすのは候補の質と量であり、どれを選ぶかの責任は人に残ります。

なお、AIを使った参加者は成果が上がっているにもかかわらず、自分の解が上位10%に入ると考える割合が9.2ポイント低い、という自信の逆転も報告されています(§6.2)。この値はAIを使った個人とチームを合わせたもので、図では個人の低下が大きく出ています(Figure 10)。導入時には、成果を本人に見える形で返す仕組みが要ります。

提言 — どう付き合っていくか

平均か、卓越か。業務ごとに編成を決める

フィールフロウの実践案です。順序そのものを論文が検証したものではありません。

  1. 業務を2種類に分ける一定水準を期日までに出す業務と、突出した解が要る業務を分ける。前者はAI付き個人、後者は異職能ペア+AIを候補にする。
  2. 評価者と基準を先に決める成果物を誰がどの基準で評価するかを決め、AIあり・なしで同じ基準で比べる。自己申告の手応えは指標にしない。
  3. 選別の責任を人に残すAIが出した候補から採用案を選ぶ工程と、その責任者を明示する。候補の量が増えるほど、選別の設計が効く。

AIは候補の質と量を上げる。誰と組み、誰が選ぶかは、業務ごとに人が決める。

この実験は1社の1日限りのワークショップで、日常業務の長期的な効果は検証していません。御社で試すなら、最初の対象には異職能2人で企画書を作る業務のように、実験と条件が近いものを選び、評価基準を先に決めてから比較することを提案します。

フィールフロウでは、生成AIを前提にしたチーム編成や、成果物の評価基準の設計についてご相談いただけます。今の体制で「AIに任せたい業務」と「人が残す判断」を分けるところから、一緒に整理します。チーム設計と業務の切り分けについて相談する

出典・参照データ

本レポートの分析は以下の一次情報に基づいています。統計・数値の詳細は各出典をご確認ください。

  1. The Cybernetic Teammate: A Field Experiment on Generative AI Reshaping Teamwork and Expertise(NBER Working Paper 33641)
    Dell'Acqua, Ayoubi, Lifshitz, Sadun, Mollick, Mollick, Han, Goldman, Nair, Taub, Lakhani / NBER

    §3の実験設計とTable 1、Table 2の品質効果、§5.1の時間、Table 5の職務別、Table 6の感情、Table 10の上位10%、§7の限界。本稿の数値はすべてこの2025年4月版(日付表記は月のみ)から引用

  2. The Cybernetic Teammate(Harvard Business School Working Paper 25-043)
    Harvard Business School

    初出のワーキングペーパー。著者所属と利益相反の記載(P&GからD^3への寄付、Lakhani教授の過去のコンサルティング)を参照。主要数値はNBER版と同一

  3. The Cybernetic Teammate: A Field Experiment on Generative AI and Teamwork(Organization Science, Vol. 37, No. 4)
    INFORMS

    査読誌掲載版。要旨で分析対象を791名と記載し、アイデア生成はAIが高め、選別は人の判断が価値を保つとの知見が加わった点を参照。本文の数値は未照合のため本稿では引用しない