虚假奖励:重新思考 RLVR 中的训练信号
人工智能
2026-02-26 v2 机器学习
摘要
我们展示了强化学习可验证奖励(RLVR)即使使用与正确答案几乎无关、没有或甚至负相关的虚假奖励,也能在某些语言模型中引发强大的数学推理能力。例如,RLVR 使用随机分配奖励的训练可使 Qwen2.5-Math-7B 在 MATH-500 上的性能提升 21.4 个百分点,几乎匹配来自真实奖励的 29.1 个百分点的提升。为解释这一反直觉现象,我们展示了 GRPO 在 clip 项中存在的 clipping bias,这种 bias 可能在没有信息性奖励的情况下放大预训练期间学习的高先前行为。在案例研究中,我们识别出 Qwen2.5 模型中的一种此类行为,即 code reasoning(在不实际执行 code 的情况下进行 code 推理);code-reasoning 频率从 65% 增加到 90% 以上,均伴随虚假奖励。然而,此类可放大行为高度依赖于模型。在实际中,对于 Qwen 模型有效的虚假奖励往往对其他模型族(如 Llama3 或 OLMo2)几乎无效。我们的结果凸显了在不同模型之间验证 RL 方法的重要性,而不应依赖单一事实选择:即使来自不反映真实能力提升的随机奖励,也可在 Qwen 模型上实现显著收益。
关键词
引用
@article{arxiv.2506.10947,
title = {Spurious Rewards: Rethinking Training Signals in RLVR},
author = {Rulin Shao and Shuyue Stella Li and Rui Xin and Scott Geng and Yiping Wang and Sewoong Oh and Simon Shaolei Du and Nathan Lambert and Sewon Min and Ranjay Krishna and Yulia Tsvetkov and Hannaneh Hajishirzi and Pang Wei Koh and Luke Zettlemoyer},
journal= {arXiv preprint arXiv:2506.10947},
year = {2026}
}