中文

用于检索增强生成输出事实核查的忠实性感知不确定性量化

计算与语言 2026-04-30 v5

摘要

结合检索的大型语言模型(LLM),即检索增强生成(RAG),在开放域问答中取得了出色的性能。然而,RAG 仍然容易产生幻觉:由于模型内部知识和检索上下文中的不准确信息,可能会产生事实错误的输出。现有的缓解幻觉的方法通常将事实性与对检索证据的忠实性混为一谈,如果事实正确的陈述未得到检索的明确支持,就会将其错误地标记为幻觉。在本文中,我们引入了 FRANQ,一种用于 RAG 输出幻觉检测的新方法。FRANQ 根据陈述是否忠实于检索上下文,应用不同的不确定性量化(UQ)技术来估计事实性。为了评估 FRANQ 及竞争性 UQ 方法,我们构建了一个新的长篇问答数据集,该数据集同时标注了事实性和忠实性,结合了自动标注与对困难案例的人工验证。在多个数据集、任务和 LLM 上的广泛实验表明,与现有方法相比,FRANQ 能够更准确地检测 RAG 生成回答中的事实错误。

关键词

引用

@article{arxiv.2505.21072,
  title  = {Faithfulness-Aware Uncertainty Quantification for Fact-Checking the Output of Retrieval Augmented Generation},
  author = {Ekaterina Fadeeva and Aleksandr Rubashevskii and Dzianis Piatrashyn and Roman Vashurin and Shehzaad Dhuliawala and Artem Shelmanov and Timothy Baldwin and Preslav Nakov and Mrinmaya Sachan and Maxim Panov},
  journal= {arXiv preprint arXiv:2505.21072},
  year   = {2026}
}