中文

AI代理的非标准误差

人工智能 2026-03-20 v2 社会与信息网络

摘要

我们研究了给定相同数据和研究问题后,面向性价比AI编码代理是否产生相同的实证结果。部署150个自主Claude Code代理独立测试关于NYSE TAQ中SPY(2015--2024)市场质量趋势的六个假设,我们发现AI代理 exhibits显著的非标准误差(NSE),即源于代理间分析选择差异的不确定性,类似于人类研究者所记录的现象。AI代理在度量选择上差异显著(例如,自相关 vs. 方差比,美元 vs. 股份volume)。不同模型家族(Sonnet 4.6 vs. Opus 4.6)表现出稳定的"经验风格",反映出方法论偏好上的系统性差异。在三个阶段的反馈协议中,AI同行评审(书面批判)对离散度的影响最小,而暴露于顶级示例论文可将估计值的四分位范围缩小80--99%,但仅限于在"收敛"度量家族中。收敛既通过家族内部估计紧缩也通过代理完全切换度量家族实现,但收敛反映的是模仿而非理解。这一发现对AI在自动化政策评估和实证研究中的日益增长使用具有启示意义。

关键词

引用

@article{arxiv.2603.16744,
  title  = {Nonstandard Errors in AI Agents},
  author = {Ruijiang Gao and Steven Chong Xiao},
  journal= {arXiv preprint arXiv:2603.16744},
  year   = {2026}
}

备注

45 pages