GhostCite:大语言模型时代引用有效性的大规模分析
密码学与安全
2026-05-15 v2 人工智能
摘要
引用是信任科学主张的基础;当引用无效或被造时,这种信任就会崩溃。随着大语言模型(LLM)的出现,这一风险有所加剧:LLM 正在被广泛用于学术写作,但其倾向于制造引用(“幽灵引用”)对引用有效性构成系统性威胁。为量化这一威胁,我们开发了 \citeb 框架,用于大规模引用验证,并通过三个互补实验进行全面研究:第一,对 13 个 LLM 在 various research 领域的引用生成任务进行基准测试,发现所有模型都以 14.23% 至 94.93% 的比例幻觉生成引用;第二,分析 2020--2025 年 AI/ML 和 Security 场域 56,381 篇论文中 220 万条引用,发现 1.07% 的论文包含无效引用,2025 年的增长率为 80.9%;第三,调查 97 名研究者,发现 87.2% 使用 AI 工具,76.7% 的评审者不 thorough 检查参考文献,74.5% 认为同行评审在捕捉引用错误方面无效。基于这些发现,我们认为幽灵引用构成对学术完整性的系统性威胁,并呼吁社区协合行动以应对这一挑战。
引用
@article{arxiv.2602.06718,
title = {GhostCite: A Large-Scale Analysis of Citation Validity in the Age of Large Language Models},
author = {Zuyao Xu and Yuqi Qiu and Lu Sun and Fasheng Miao and Fubin Wu and Xiang Li and Xinyi Wang and Haozhe Lu and Zhengze Zhang and Yuxin Hu and Jialu Li and Luo Jin and Feng Zhang and Rui Luo and Xinran Liu and Yingxian Li and Jiaji Liu},
journal= {arXiv preprint arXiv:2602.06718},
year = {2026}
}