- AIコーディングエージェントを入れた企業で、コード量は約30%増えました
- ところが完了した仕事の数には、統計的に意味のある増加がありませんでした
- 原因はレビュー(コードの確認作業)が詰まることで、マージまでの時間は49%延びました
- 別の研究でも、コミット240%増がリリース30%増まで縮むと報告されています
- 導入を考える会社は、書く速さよりレビューと出荷の流れを見直すのが大事です
「AIで開発が3倍速くなった」という話を聞いて、うちも入れようかと迷っていませんか。ハーバード大学の研究者が700社超のデータを調べたところ、コードは増えても完成した仕事は増えていませんでした。この記事では、その理由と導入のヒントを整理します。
何が発表されたのか
2026年10月9日、Ars Technicaが、ハーバード大学のFiona Chen氏とJames Stratton氏による研究を報じました。タイトルは「AIコーディングエージェントはコードを増やすが、ソフトウェアは増えていない」です。
調べたのは、エンジニアリング分析会社Jellyfishが集めた700社超のソフトウェア企業のデータです。対象は70万人超の従業員で、2021年から2026年3月までの約3億件の作業記録(コミットやプルリクエストなど)が使われました。
コーディングエージェントとは、人が指示すると自分でコードを書き、修正まで進めるAIのことです。研究は、各社がこれを導入した前後で、活動量がどう変わったかを比べています。
コードは増えた、でも仕事は終わらない
増えた数字
導入後、各社は平均で次のように変わりました。
- コードの行数が30%増えた
- コミット(変更の保存単位)が20%増えた
- プルリクエスト(変更を取り込んでほしいという依頼)が23%増えた
ここまでは「AIのおかげで生産性が上がった」と読めます。
増えなかった数字
ところが、Jiraで管理されている課題(バグ修正や機能追加などの仕事)の解決率には、統計的に意味のある改善が見られませんでした。つまり、書かれたコードの量と、終わった仕事の量が連動していなかったのです。
引っ越しで段ボール箱ばかり運び込まれ、荷ほどきの終わった部屋が増えない状態に近いでしょう。
詰まった場所はレビュー
研究者が注目したのは、コードを書いたあとの確認作業です。プルリクエストは、ほかの人が読んでOKを出してから本体に取り込まれます。この作業をレビューと呼びます。
導入後のレビューには、次の変化が出ました。
- 提出からマージ(取り込み)までの平均時間が49%延びた
- 1件あたりのコメントが35%増えた
- 修正が必要になる割合がほぼ2倍になった
- レビューを担当する人の割合が14%増えた
想像してみてください。AIのおかげで、チーム全員が出す変更依頼が増えたとします。レビュー担当者の時間は変わらないので、確認待ちの列は長くなる一方です。しかも直しの指摘まで増えるため、依頼と修正を何度も行き来することになります。
2026年3月の時点で、測定した企業の80%がAIによるコードレビューを使っていました。AIはレビューコメントの23.3%、プルリクエストの10.8%に関わっています。それでも流れの詰まりは解けていません。
別の研究も同じ方向を指す
この結果は単独ではありません。全米経済研究所(NBER)のワーキングペーパー「Writing Code vs. Shipping Code」は、GitHubの開発者50万人超を調べました。
コミット数への累積の効果は、オートコンプリート(入力補完)が30%、対話型エージェントが180%、自律型エージェントが240%でした。ところが、プロジェクト数では80%、リリース数では30%まで縮みます。
著者らは、AIの作業と人間の作業が強く補い合う関係にあるためだと見ています。人間の作業が弱い輪となって、全体の速さを決めるという考え方です。AIと人間の作業の代替しやすさを示す数値(代替の弾力性)は0.23と推定されています。
さらに、4つの大きなアプリ市場では、新しいアプリが大きく増えたのに、総利用量は増えていませんでした。
過去の研究との比べ方
AIの生産性を測る研究は、結果が割れてきました。主な3つを並べます。
- METR(2025年): 経験豊富な開発者16人、246件の課題で実験。AIありのほうが19%遅かった
- NBER(2026年): 開発者50万人超。コミットは増えるが、リリースは30%増にとどまる
- ハーバード大学(2026年): 企業700社超。コードは30%増、完了した仕事は変化なし
METRの実験では、開発者は事前に「24%速くなる」と予想し、終わったあとも「約20%速くなった」と感じていました。実際は逆だったのです。
ただしMETR自身が、この結果はすでに古いとしています。2026年2月に、2025年後半のツールで新しいデータを出しました。研究ごとに対象や期間が違うので、数字を直接比べるのは危険です。
日本の企業にとっての意味
今回の研究が調べたのは海外の企業で、日本の会社を直接見たものではありません。それでも、レビューで流れが詰まるという構造は、日本のチームにも当てはまる可能性があります。
たとえば、3人でAIを導入した小さな開発チームを考えてみましょう。1人あたりの変更依頼が倍になっても、レビューできるのが経験の長い1人だけなら、その人に仕事が集中します。新機能のリリースは、かえって遅れるかもしれません。
外注に開発を任せる会社も同じです。納品されるコードが増えても、検収(受け入れの確認)をする人が足りなければ、完成は早まりません。
導入の効果を測るときは、コードの行数よりも、課題の完了数やリリースまでの日数を見ることが大事です。
この研究の限界
この研究にも限界があります。観察データなので、エージェントがすべての変化の原因だとは言い切れません。
データは2026年3月で終わっているため、その後に出た新しいツールや使い方の変化は測れていません。49%という数字も、レビューの経過時間であり、人が実際に作業した時間ではありません。
また、「AIで新しいソフトウェアが増えない」と言っているわけでもありません。見つかったのは、追跡された課題の完了数に、統計的に意味のある改善がなかったという点です。
一方で、MacStoriesが紹介したAppfiguresの調査では、2026年1〜3月のアプリ公開数が前年同期より60%増えています。ただし筆者のJohn Voorhees氏も、この種の数字は慎重に見るべきだと書いています。
よくある質問(FAQ)
Q. AIコーディングエージェントは役に立たないのですか?
役に立たないとは言えません。コードの行数やコミットは増えています。ただ、完了した仕事の増加までは確認できなかった、というのが今回の結果です。
Q. レビューをAIに任せれば解決しますか?
測定した企業の80%がすでにAIレビューを使っていますが、研究では詰まりが解けていません。AIに任せるだけでは足りない可能性があります。
Q. 日本のデータでも同じ結果になりますか?
今回の研究は日本の企業を直接調べていないので、断言はできません。自社の課題完了数やリリース頻度を測って確かめるのが確実です。
Q. 今のAIツールでも結果は変わらないのでしょうか?
まだ分かっていません。データは2026年3月までで、その後の新しいツールは含まれていないためです。
まとめ
- AIエージェントの導入で、コードは約30%増えた
- 完了した仕事の数には、統計的に意味のある増加がなかった
- レビューの時間が49%延び、確認作業が詰まりの原因になっている
- NBERの研究でも、コミット240%増がリリース30%増に縮んでいる
まずは自分のチームで、コードの量ではなく、課題の完了数とレビュー待ちの時間を測ってみてください。
参考文献
- AI coding agents boosted code output without clear task completion gains, study finds(Superpower Daily)
- Harvard Study Finds AI Coding Agents Lift Code 30% but Fail to Raise Software Output(Zetik)
- Writing Code vs. Shipping Code: Productivity Effects Across Generations of AI Coding Tools(NBER)
- Early-2025 AI experienced open-source developer study(METR)
- Coding Agents Are Reshaping the App Store(MacStories)
