中文

论 RLVR 中的隐式奖励过拟合与低秩动力学

机器学习 2026-05-08 v1 人工智能

摘要

近期的大量研究表明,模型通过具有可验证奖励的强化学习(RLVR)获得的增强推理能力主要集中在 rank-1 分量中。基于这一观察,我们采用了周期性 rank-1 替换,并发现了一个反直觉的现象:RLVR 可能会对训练数据集表现出隐式奖励过拟合。具体而言,即使模型在训练过程中的奖励保持相对较低,它也能在测试集上取得令人满意的性能。此外,我们刻画了 RL 训练的三个独特属性:(1) RLVR 中的有效 rank-1 分量不维持除数学推理能力以外的其他模型知识。(2) RLVR 本质上是通过优化特定的奇异谱来发挥作用的。RLVR 训练模型中几乎所有线性层的奇异值分布表现为重尾分布。(3) 与 rank-1 分量相关的左奇异向量在训练过程中表现出更强的对齐趋势,这呼应了 RLVR 本质上是在优化采样效率的发现。总而言之,我们的发现与分析进一步揭示了 RLVR 如何塑造模型参数,并为改进现有 RL 范式或其他训练范式以实现持续学习提供了潜在见解。

关键词

引用

@article{arxiv.2605.06523,
  title  = {On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR},
  author = {Hao Ye and Jisheng Dang and Junfeng Fang and Bimei Wang and Yizhou Zhang and Ning Lv and Wencan Zhang and Hong Peng and Bin Hu and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2605.06523},
  year   = {2026}
}