論文レポート生成AIAIは数週間規模の開発タスクを完遂できるか — METRの時間軸(time horizon)研究とMirrorCode初期結果から読む「委任範囲」の動きMirrorCodeの4月初期結果では、Claude Opus 4.6が約16,000行のgotreeを再実装し、2,001テスト中2,000件に合格。6〜7月の完全版では25対象・最強モデル56%へ拡張され、Opus 4.7がgotreeを14時間・251ドルで再実装しました。初期値と完全版を分け、AIへ任せる条件を整理します。分析岡崎 太公開日2026年8月28日出典数出典 7件
論文レポートAIエージェントエージェントは「チームメイト」になれるか — 652タスクで観測された「協調の呪い」、CooperBench を読むStanfordとSAP LabsのCooperBenchは、652の協調コーディングタスクで、2体のエージェントが1体より低い成功率になる「協調の呪い」を観測しました。SoloとCoopの比較、46タスクの人数拡張実験、失敗トレース分析を分けて読み、人間が設計すべき分担・計画・統合ゲートを整理します。分析岡崎 太公開日2026年8月27日出典数出典 2件
論文レポートAIエージェントコンサル・銀行・弁護士の実務タスクでAIエージェントはどこまでできるか — APEX-Agents が示す「任せられる粒度」の現在地投資銀行アナリスト・経営コンサルタント・企業弁護士の実務経験者が作った480の長時間クロスアプリタスクで、8種のAIエージェントを評価したベンチマーク APEX-Agents(Mercor、2026年1月公開)を読み解きます。一発成功率は論文の評価時点で最高24.0%。この数字を「仕事が代替されるか」ではなく「どの粒度なら任せられるか」の地図として読み、業務の切り出し方に落とし込みます。分析岡崎 太公開日2026年8月20日出典数出典 3件
論文レポートAIエージェントAIエージェントは実際「何に」使われているのか — 17.7万MCPツールの実証分析が示す「語られる未来」と「作られている現在」AIエージェントは営業も人事も変えると語られますが、公開MCPツールの実測データは別の姿を示します。17万7,436件を分析した英AIセキュリティ研究所の論文をもとに、公開ツールの67%がソフトウェア開発向けという現在地と、環境を直接変更する「アクション型」へのシフトを読み解き、自社のエージェント導入領域の選び方に落とし込みます。分析岡崎 太公開日2026年8月18日出典数出典 3件
論文レポート生成AI自己申告とRCTはなぜずれるのか — METR調査の「価値1.4〜2倍」と熟練OSS開発者の「完了時間19%増」METRの349名調査では、AIツールによる仕事の価値変化は自己申告で中央値1.4〜2倍。しかしMETR自身が「この数字には懐疑的になる理由がある」と注記しています。同じMETRのRCTでは、経験豊富なOSS開発者はAI利用で19%遅くなったのに「20%速くなった」と体感していました。体感と実測の乖離という研究の系譜を追い、体感ROIだけで意思決定する危うさと実測の設計方法に着地させます。分析岡崎 太公開日2026年8月17日出典数出典 3件
論文レポート生成AI「生成AI導入の95%はP&L効果なし」をどう読むか — MIT NANDAレポートの定義・調査の限界・残り5%の構造「生成AI導入の95%は測定可能なP&L効果を生んでいない」——2025年夏に世界中で引用されたMIT Project NANDAのレポートを、原典に当たって検証します。95%が何の95%なのか、調査の母集団と「成功」の定義、レポート自身が明記する調査の限界を整理し、センセーショナルな数字に出会ったときの判断軸と「残り5%は何が違うのか」の構造分析に着地します。分析岡崎 太公開日2026年8月13日出典数出典 2件