中文

幻影引用:在顶级会议上通过同行评审的幻觉引用

数字图书馆 2026-07-01 v1 人工智能

摘要

大型语言模型可以生成包含无根据主张的流畅科学文本,使得幻觉进入档案记录。通过技术陈述评估这种风险很困难,通常需要专家判断,但引用提供了一个更易审计的表面:一个参考文献要么解析为具有兼容作者身份的真实学术作品,要么不能。我们使用限于身份层面失败的保守定义来衡量同行评审论文集(proceedings)中的引用幻觉:不存在的作品和实质性的作者列表不匹配。我们明确排除了普通的书目漂移(例如,会议/年份差异、出版状态更新、次要姓名变体)。为了大规模审计引用,我们构建了 RefChecker,一个验证流程,将书目条目解析到多个书目来源,并将未解决的案例升级到网络搜索重新验证。我们将 RefChecker 应用于来自 ICLR、ICML、NeurIPS 和 USENIX Security 的已接受 camera-ready 论文。幻觉引用已进入档案记录。虽然参考文献层面的比率通常低于 1%,但论文集足够大,论文层面的失败是可见的:在 2025 年,根据我们的严格定义,大约每二十篇 NeurIPS 和 USENIX Security 论文中就有一篇包含至少两个可能的幻觉学术论文类引用。我们还观察到多个会议在 ChatGPT 之后有所增加,包括单个书目中出现 5 次以上失败的论文尾部,甚至获奖论文中也存在可能的幻觉引用。这些结果表明,仅靠同行评审并不能可靠地执行引用完整性,但审计是可行的(在一次会议规模扫描中,每篇论文约 0.04 美元)。我们开源 RefChecker,用于在发表前进行常规、可复现的引用验证(https://github.com/markrussinovich/refchecker)。

关键词

引用

@article{arxiv.2607.00738,
  title  = {Phantom References: Hallucinated Citations That Survive Peer Review at Top-Tier Conferences},
  author = {Mark Russinovich and Ram Shankar Siva Kumar and Ahmed Salem},
  journal= {arXiv preprint arXiv:2607.00738},
  year   = {2026}
}