中文

学习事实性推理

计算与语言 2025-08-08 v1

摘要

推理型大型语言模型(R-LLM)在复杂推理任务中取得了显著进展,但在长篇事实性基准测试上常生成比非推理模型更多的幻觉。然而,将在线强化学习(RL)——近期R-LLM进展中的关键组件——扩展到长篇事实性场景面临诸多独特挑战,主要由于缺乏可靠的验证方法。以FActScore等自动事实性评估框架构建偏好数据以进行离线RL的先前工作表明,直接将此类方法作为奖励用于在线RL会以多种方式导致奖励攻击,例如生成较少或不相关的响应。我们提出了一种新型奖励函数,同时考虑事实精确性、响应细节水平和答案相关性,并应用于在线RL以学习高质量的事实推理。在六个长篇事实性基准测试上的评估显示,我们的事实推理模型在幻觉率上平均降低了23.1个百分点,回答细节水平提升23%,整体响应有用性未出现负面影响。

关键词

引用

@article{arxiv.2508.05618,
  title  = {Learning to Reason for Factuality},
  author = {Xilun Chen and Ilia Kulikov and Vincent-Pierre Berges and Barlas Oğuz and Rulin Shao and Gargi Ghosh and Jason Weston and Wen-tau Yih},
  journal= {arXiv preprint arXiv:2508.05618},
  year   = {2025}
}