AI代理的非标准误差
人工智能
2026-03-20 v2 社会与信息网络
摘要
我们研究了给定相同数据和研究问题后,面向性价比AI编码代理是否产生相同的实证结果。部署150个自主Claude Code代理独立测试关于NYSE TAQ中SPY(2015--2024)市场质量趋势的六个假设,我们发现AI代理 exhibits显著的非标准误差(NSE),即源于代理间分析选择差异的不确定性,类似于人类研究者所记录的现象。AI代理在度量选择上差异显著(例如,自相关 vs. 方差比,美元 vs. 股份volume)。不同模型家族(Sonnet 4.6 vs. Opus 4.6)表现出稳定的"经验风格",反映出方法论偏好上的系统性差异。在三个阶段的反馈协议中,AI同行评审(书面批判)对离散度的影响最小,而暴露于顶级示例论文可将估计值的四分位范围缩小80--99%,但仅限于在"收敛"度量家族中。收敛既通过家族内部估计紧缩也通过代理完全切换度量家族实现,但收敛反映的是模仿而非理解。这一发现对AI在自动化政策评估和实证研究中的日益增长使用具有启示意义。
引用
@article{arxiv.2603.16744,
title = {Nonstandard Errors in AI Agents},
author = {Ruijiang Gao and Steven Chong Xiao},
journal= {arXiv preprint arXiv:2603.16744},
year = {2026}
}
备注
45 pages