中文

误即人间:通过大语言模型系统量化已发表人工智能论文中的错误

人工智能 2025-12-08 v1 计算与语言

摘要

已发表人工智能论文中包含多少错误?经过同行评审的出版物是新研究和知识构建的基石。文献中潜伏的错误可能在不知情的情况下扩散,导致后续研究产生混淆并 complicate reproducibility。研究的不断加快以及对同行评审系统日益增长的要求使得此类错误更难检测和避免。为此,我们开发了基于 GPT-5 的论文正确性检查器,用于系统识别已在顶级人工智能会议和期刊上发表的论文中的错误。我们的分析聚焦于客观错误——例如公式、推导、计算、图表中的错误——这些错误具有明确可验证的真实依据。我们有意排除诸如新颖性、重要性或写作质量等主观考量。我们发现已发表的论文包含相当数量的客观错误,并且每篇论文中的错误平均数量随时间增加——从 NeurIPS 2021 的 3.8 个增长到 NeurIPS 2025 的 5.9 个(增加 55.3%);从 ICLR 2018 的 4.1 个增长到 ICLR 2025 的 5.2 个;从 TMLR 2022/23 的 5.0 个增长到 TMLR 2025 的 5.5 个。人类专家审阅了 316 个由 AI 检查器识别的潜在错误,确认其中 263 个为实际错误,对应精确率为 83.2%。虽然大多数识别出的问题相对较小,但纠正这些问题会减少文献中的混淆并加强可重复性。AI 检查器还揭示了可能更为实质性的错误,这些错误可能影响结果的解释。此外,我们展示了 AI 检查器可为 75.8% 的识别错误提出正确的修复方案。总体而言,本研究突显了前沿大语言模型检测和纠正已发表论文中客观错误的潜力,有助于建立更坚实的知识基础。

关键词

引用

@article{arxiv.2512.05925,
  title  = {To Err Is Human: Systematic Quantification of Errors in Published AI Papers via LLM Analysis},
  author = {Federico Bianchi and Yongchan Kwon and Zachary Izzo and Linjun Zhang and James Zou},
  journal= {arXiv preprint arXiv:2512.05925},
  year   = {2025}
}