停止惩赏幻觉步骤:基于忠实性感知的小规模推理模型的分步强化学习
计算与语言
2026-05-28 v2
摘要
随着大型语言模型变得更小更高效,小规模推理模型(SRMs)对于在资源受限的环境中实现链式思考(CoT)推理至关重要。然而,这些模型容易产生忠实性幻觉,尤其是在中间推理步骤中。现有的基于在线强化学习的缓解方法依赖于基于结果的奖励或粗糙的CoT评估,这可能会在最终答案正确时不恰当地强化不可忠实的推理。为解决这些限制,我们提出了忠实性感知的分步强化学习(FaithRL),通过显式的忠实性奖励(来自过程奖励模型)引入分步骤监督,同时引入截断重抽样策略,从忠实前缀生成对比信号,并缓解分步骤奖励的奖励作弊。实验在多个SRMs和开放书籍QA基准上表明,FaithRL consistently减少了CoT和最终答案中的幻觉,导致更忠实可靠的推理。代码可在 https://github.com/Easy195/FaithRL 获取。
引用
@article{arxiv.2602.05897,
title = {Stop Rewarding Hallucinated Steps: Faithfulness-Aware Step-Level Reinforcement Learning for Small Reasoning Models},
author = {Shuo Nie and Hexuan Deng and Chao Wang and Ruiyu Fang and Xuebo Liu and Shuangyong Song and Yu Li and Min Zhang and Xuelong Li},
journal= {arXiv preprint arXiv:2602.05897},
year = {2026}
}