中文

论在可验证奖励强化学习中重新思考样本极性

计算与语言 2025-12-29 v1

摘要

大型推理模型(LRMs)通常使用可验证奖励强化学习(RLVR)来增强其推理能力。在这一范式下,使用正负样本自生成的 rollout 来更新策略,这些样本对应不同的极性。在本文中,我们对如何影响 RLVR 训练动力学和行为的样本极性进行系统性调查。我们发现,正样本会锐化现有的正确推理模式,而负样本则鼓励探索新的推理路径。我们进一步探讨了在样本水平和 token 水平上调整正负样本的优势值如何影响 RLVR 训练。基于这些见解,我们提出了一种用于策略优化的自适应和非对称 token 级优势塑形方法,称为 A3PO(Adaptive and Asymmetric token-level Advantage shaping for Policy Optimization),该方法更精确地在不同极性中为关键 token 分配优势信号。在五个推理基准测试中进行实验,证明了我们方法的有效性。

关键词

引用

@article{arxiv.2512.21625,
  title  = {Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards},
  author = {Xinyu Tang and Yuliang Zhan and Zhixun Li and Wayne Xin Zhao and Zhenduo Zhang and Zujie Wen and Zhiqiang Zhang and Jun Zhou},
  journal= {arXiv preprint arXiv:2512.21625},
  year   = {2025}
}