图书馆推荐中的幻觉:引用频率作为训练数据冗余的代理指标
计算与语言
2025-10-30 v1 人工智能
摘要
大型语言模型(LLM)正日益被应用于从自然语言理解到代码生成的广泛任务。尽管它们也被用于图书馆推荐,但不存在的论文幻觉仍是一个主要问题。基于前期研究,本研究假设 LLM 正确生成图书馆信息的能力取决于其底层知识是生成还是记忆,高度引用论文(即在训练语料库中出现频率更高)显示出较低的幻觉率。我们因此假设将引用次数作为训练数据冗余(即给定图书馆记录在预训练语料库中重复表示的频率)的代理指标,并研究引用频率如何影响 LLM 输出中幻觉参考的现象。使用 GPT-4.1,我们生成并手动验证了 100 条跨二十个计算机科学领域的图书馆记录,并通过生成的元数据与真实元数据之间的余弦相似度衡量事实一致性。结果显示:(i) 幻觉率在不同研究领域之间存在差异,(ii) 引用次数与事实准确性呈强相关性,(iii) 超过约 1000 次引用后,图书馆信息几乎是逐字记忆的。这些发现表明高度引用论文几乎是逐字保留在模型中的,表明存在一个阈值,使得泛化从记忆转向。
引用
@article{arxiv.2510.25378,
title = {Hallucinations in Bibliographic Recommendation: Citation Frequency as a Proxy for Training Data Redundancy},
author = {Junichiro Niimi},
journal= {arXiv preprint arXiv:2510.25378},
year = {2025}
}