中文

构思瓶颈:分解AI生成与人类经济学研究之间的质量差距

综合经济学 2026-04-07 v1 人工智能 计算机与社会 经济学

摘要

自主AI系统现在可以生成完整的经济学研究论文,但在直接对比中,其表现仍显著低于人类发表的论文。本文将质量差距分解为两个独立组成部分:研究构思质量和执行质量。我们使用一个在发表决策上训练的双模型集成微调语言模型(Gong, Li, and Zhou, 2026)来评估构思质量,并使用由Gemini 3.1 Flash Lite评估的全面六维评分标准来评估执行质量——该模型家族与APE锦标赛裁判相同,确保了方法论一致性——我们分析了953篇经济学论文,包括912篇来自APE项目的AI生成论文和41篇发表在《美国经济评论》和《AEJ: Economic Policy》上的人类论文。构思质量差距很大(Cohen's d = 2.23, p < 0.001),人类论文的平均集成卓越概率为47.1%,而AI为16.5%。执行质量差距也显著但较小(d = 0.90, p < 0.001),人类论文评分为4.38/5.0,而AI为3.84。构思质量约占总质量差异的71%,执行贡献29%。最大的执行弱点是机制分析深度(d = 1.43);在稳健性方面未发现显著差异。我们记录到74%的AI论文采用了双重差分法,且仅有7篇AI论文(0.8%)在构思和执行质量上同时超越了人类论文的中位数。AI生成经济学研究具备竞争力的主要瓶颈仍然是构思。

关键词

引用

@article{arxiv.2604.03338,
  title  = {The Ideation Bottleneck: Decomposing the Quality Gap Between AI-Generated and Human Economics Research},
  author = {Ning Li},
  journal= {arXiv preprint arXiv:2604.03338},
  year   = {2026}
}