ConfRAG:置信度引导的检索增强生成
计算与语言
2025-10-01 v2
摘要
大型语言模型(LLM)能否被训练以避免生成事实错误陈述?检索增强生成(RAG)是否只有在必要时才会被触发,以减少检索和计算成本?本文同时解决上述两个挑战。我们引入ConfQA,这是一种微调策略,可将事实基准测试中的幻觉率从20%-40%降至5%以下。该方法简单有效:当模型正确作答时,对其进行训练以输出答案;否则训练其回复“我不确定”。两项设计选择使该训练效果显著:(1)一个降噪提示语(“仅在您有把握时才回答”),明确阻止过度自信的幻觉;(2)从原子事实陈述(如知识图谱属性值)中获取训练数据,校准模型置信度,使其在不同领域和问题类型上均具备鲁棒性。基于ConfQA,我们提出ConfRAG,这是一种仅在模型回复“我不确定”时调用RAG的触发策略。该框架在理想情况下实现95%以上的准确率,同时将不必要的外部检索减少30%以上。
引用
@article{arxiv.2506.07309,
title = {ConfRAG: Confidence-Guided Retrieval-Augmenting Generation},
author = {Yin Huang and Yifan Ethan Xu and Kai Sun and Vera Yan and Alicia Sun and Haidar Khan and Jimmy Nguyen and Jingxiang Chen and Mohammad Kachuee and Zhaojiang Lin and Yue Liu and Aaron Colak and Anuj Kumar and Wen-tau Yih and Xin Luna Dong},
journal= {arXiv preprint arXiv:2506.07309},
year = {2025}
}
备注
10 pages main content, 7 pages appendix, 6 figures, 10 tables