中文

jagged AI 在科学同行评审中的表现:基于 POMP 数据分析的实证研究

应用统计 2026-05-19 v2

摘要

尽管人工智能 (AI) 工具在学术写作和统计分析中正逐渐广泛应用,但其在科学同行评审中的表现仍属未充分探索的领域。一个关键挑战是“jagged AI”,即 AI 在某些领域表现出强大的能力峰值,而在其他领域则表现不足。为在实际数据科学情境中研究这种 jaggedness,我们考察了部分观测马尔可夫过程 (POMP) 数据分析的评审任务。POMP 模型,也称为状态空间模型或隐马尔可夫模型,用于拟合用于疾病传播、生态动力学和金融风险评估等多种应用领域的时间序列数据的机制性动态模型。高质量的同行评审涉及对科学背景的评估、识别在实施复杂算法时可能出现的错误,以及关于方法论最佳实践的决策。我们研究了来自 University of Michigan 一门研究生时间序列课程四个学期的 72 个 POMP 项目,项目报告、源代码和学生同行评审均已匿名化并公开。我们将人类评审与四个 AI 评审代理进行比较,这四个代理分别使用Claude Code并采用不同的指令文件实现。我们发现,AI 评审者呈现出 jagged 的能力轮廓,能够熟练捕捉人类忽略的技术性错误和无效推断方法,而在检查解释性错误、叙事连贯性和基于领域的模型批评方面则未能达到人类标准。这种 jaggedness 对所有代理而言都相似,这与它主要是来自底层 AI 模型本身的性质相一致。技能文件配置改变了代理所强调的弱点,而未能消除 jaggedness。

关键词

引用

@article{arxiv.2605.07855,
  title  = {Jagged AI in Scientific Peer Review: Evidence from POMP Data Analysis},
  author = {Jin Wook Lee and William Szegda and Zhisheng Song and Edward L. Ionides},
  journal= {arXiv preprint arXiv:2605.07855},
  year   = {2026}
}