中文

为真而训练,保持技能:二元检索增强奖励缓解幻觉

计算与语言 2025-10-21 v1 机器学习

摘要

语言模型常会生成不受其训练数据支持的事实错误信息,称为外源性幻觉。现有的缓解方法常会降低开放式生成和下游任务上的性能,限制了实际用途。我们提出一种在线强化学习方法,使用一种新颖的二元检索增强奖励(RAR)来解决这一权衡。不同于连续奖励方案,本方法仅当模型输出完全事实正确时赋予奖励为 1,其他情况为 0。我们在 Qwen3 推理模型上进行了各种任务的评估。对于开放式生成,二元 RAR 可将幻觉率降低 39.3%,显著优于监督训练和连续奖励 RL 的基线方法。在短篇问答任务中,模型学会了校准的退让,当面对其参数知识不足时,策略性地输出“我不知道”。这一做法在 PopQA 和 GPQA 上分别减少了 44.4% 和 21.7% 的错误答案。关键的是,这些事实性提升并未损害指令遵循、数学或代码上的性能,而连续奖励 RL 虽然提升了事实性,但会引起质量退步。

关键词

引用

@article{arxiv.2510.17733,
  title  = {Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations},
  author = {Tong Chen and Akari Asai and Luke Zettlemoyer and Hannaneh Hajishirzi and Faeze Brahman},
  journal= {arXiv preprint arXiv:2510.17733},
  year   = {2025}
}