中文

LLM 幻觉在野外:来自非存在引用的大规模证据

数字图书馆 2026-05-11 v1 人工智能 计算机与社会 物理与社会

摘要

大语言模型(LLM)已知在广泛的上下文中生成 plausible 但错误信息,但 LLM 幻觉问题的真实规模和后果仍不为人所了解。本文利用科学引用这一唯一可验证对象,对 arXiv、bioRxiv、SSRN 和 PubMed Central 中的 1110 万条引用(涵盖 250 万篇论文)进行审计。我们发现,随着 LLM 广泛采用,非存在引用的数量呈锐升趋势,2025 年alone conservatively 估计有 146,932 条幻觉引用。这些错误分散在众多论文中,但在 AI 采纳快速的领域、语言特征指向 AI 辅助写作的稿件,以及小型和早期职业作者团队中尤为突出。与此同时,幻觉引用不成比例地将信用归于已知的且多为男性学者,表明 LLM 生成的错误可能加剧科学认可的既有不平等。预印本 moderation 和期刊出版流程仅捕获这些错误的极小部分,表明幻觉内容的传播已超过现有保障。综合这些发现,表明 LLM 幻觉正在大规模地渗透知识生产,威胁未来科学发现的可靠性和公平性,随着人类和 AI 系统相互依赖现有文献。

关键词

引用

@article{arxiv.2605.07723,
  title  = {LLM hallucinations in the wild: Large-scale evidence from non-existent citations},
  author = {Zhenyue Zhao and Yihe Wang and Toby Stuart and Mathijs De Vaan and Paul Ginsparg and Yian Yin},
  journal= {arXiv preprint arXiv:2605.07723},
  year   = {2026}
}