中文

序列级奖励 intra-group 学习的设计条件:Token梯度消除

机器学习 2026-05-26 v2 人工智能

摘要

使用大型语言模型(LLM)进行多步推理的强化学习通常依赖稀疏终端奖励,这导致信用分配问题条件性差:最终反馈在所有中间决策上均匀传播。这会导致梯度方差大、训练不稳定且许多无效更新,从而限制持续模型改进。我们提出了一个反事实比较框架进行信用分配。对于每个输入,该框架采样多个推理轨迹并将其差异视为对备选决策的隐式近似。这产生了一个隐式的过程级优势估计器,将稀疏终端奖励转换为对步骤敏感的学习信号。基于该框架,我们引入了隐式行为策略优化(Implicit Behavior Policy Optimization, IBPO),显著改善了训练稳定性和在数学和代码推理基准测试中的性能上限。我们的结果指向了释放LLM推理潜力的有前景的方向。

关键词

引用

@article{arxiv.2604.13088,
  title  = {Design Conditions for Intra-Group Learning of Sequence-Level Rewards: Token Gradient Cancellation},
  author = {Fei Ding and Yongkang Zhang and youwei wang and Zijian Zeng},
  journal= {arXiv preprint arXiv:2604.13088},
  year   = {2026}
}