中文

推理模型产生更多幻觉:面向大型推理模型的事实感知强化学习

计算与语言 2025-11-07 v2 人工智能

摘要

大型语言模型 通过强化学习 (RL) 优化在推理任务上取得了显著进展,在各种具有挑战性的基准测试中展现出令人印象深刻的能力。然而,我们的实证分析揭示了一个关键缺陷:面向推理的 RL 微调显著增加了幻觉的发生率。我们对 RL 训练动态进行了理论分析,指出高方差梯度、熵引起的随机性以及对虚假局部最优的易感性是导致幻觉的关键因素。为了解决这一缺陷,我们提出了事实感知的分步策略优化 (FSPO),这是一种创新的 RL 微调算法,在每个推理步骤中引入了显式的事实性验证。FSPO 利用针对给定证据的自动化验证来动态调整 token 级别的优势值,从而在整个推理过程中激励事实正确性。在使用 Qwen2.5 和 Llama 模型进行的数学推理和幻觉基准测试中的实验表明,FSPO 能够有效减少幻觉并提高推理准确性,显著提升了可靠性和性能。

关键词

引用

@article{arxiv.2505.24630,
  title  = {Reasoning Models Hallucinate More: Factuality-Aware Reinforcement Learning for Large Reasoning Models},
  author = {Junyi Li and Hwee Tou Ng},
  journal= {arXiv preprint arXiv:2505.24630},
  year   = {2025}
}

备注

accepted by NeurIPS 2025