中文

CiteCheck:基于检索的大语言模型科学文本引用幻觉检测方法

数字图书馆 2026-05-28 v1 人工智能

摘要

大型语言模型(LLM)越来越多地被用于生成科学报告,但它们可能会生成看似合理的参考文献,却包含损坏的元数据或指向不存在的论文。我们介绍 CiteCheck,一种用于引用幻觉检测的混合框架,该框架验证引用是否对应真实的学术工作以及其元数据是否忠实于该工作。CiteCheck 从外部学术来源检索候选论文, 将引用与检索到的候选论文进行比较,并使用结构化 LLM 验证器对比, 将验证器分数映射为三个标签:Exact、Minor 和 Major。我们还构建了一个包含 982 条引用的物理学基准数据集,包含受控损坏,既捕捉到细微的元数据漂移,也捕捉到完全虚构的引用。在 held-out 测试集上,CiteCheck 实现了 88.7 的宏平均 F1 分数和 88.9% 的准确率,超过了 GPT、Claude 和 Gemini 的基线,包括 web-search 和 few-shot 变体。这些结果表明,可靠的引用验证从结合学术检索、结构化 LLM 基于比较和校准决策规则方面受益。

关键词

引用

@article{arxiv.2605.27700,
  title  = {CiteCheck: Retrieval-Grounded Detection of LLM Citation Hallucinations in Scientific Text},
  author = {Khashayar Khajavi and Shaghayegh Sadeghi and Rise Adhikari and Alexander Tessier},
  journal= {arXiv preprint arXiv:2605.27700},
  year   = {2026}
}