将结果监督内化为过程监督:强化学习推理的新范式
机器学习
2026-05-26 v2 人工智能
计算与语言
摘要
强化学习用于推理的核心挑战不仅在于结果级监督的稀疏性,更在于如何将仅在序列末尾提供的反馈转化为可指导中间推理步骤的细粒度学习信号。现有方法要么依赖结果级奖励进行序列级优化,导致精确的信用分配困难;要么依赖外部构建的过程监督,成本高昂且难以可持续扩展。为此,我们提出了一种新观点:强化学习用于推理可被理解为将结果监督内化为过程监督的问题。从这一视角出发,我们引入一种用于强化学习推理的监督内化方法,使模型能够通过识别、纠正和重用失败的推理轨迹,从而在仅有结果监督的条件下实现更细粒度的策略优化。我们进一步将这一思想抽象为一种新训练范式,即模型在强化学习过程中持续生成并完善自身的内部过程监督,为强化学习推理中的细粒度信用分配开辟了一条不同于外部提供过程监督的新道路。
引用
@article{arxiv.2605.05226,
title = {Internalizing Outcome Supervision into Process Supervision: A New Paradigm for Reinforcement Learning for Reasoning},
author = {Fei Ding and Yongkang Zhang and Runhao Liu and Yuhao Liao and Zijian Zeng and Sibo wang and Huiming Yang},
journal= {arXiv preprint arXiv:2605.05226},
year = {2026}
}