中文

未走之路:RLVR 可证明地偏离主方向学习

机器学习 2025-11-12 v1 人工智能

摘要

Reinforcement Learning with Verifiable Rewards (RLVR) 能可靠地提升大语言模型的推理性能,然而它似乎仅修改了极小一部分参数。我们重新审视这一悖论,并表明稀疏性是模型条件化优化偏差的表面假象:对于固定的预训练模型,参数更新始终局限于特定的偏好参数区域,这在多次运行间高度一致,且对数据集和 RL 策略在很大程度上保持不变。我们通过“三门理论”(Three-Gate Theory) 对这些动态过程进行了机制性解释:门 I(KL Anchor)施加 KL 约束更新;门 II(Model Geometry)将更新步长引导偏离主方向,进入低曲率、保谱子空间;门 III(Precision)将非偏好区域的微更新隐藏,使得偏离主方向的偏差表现为稀疏性。随后我们验证了该理论,并首次提供了 RLVR 学习动态的参数级表征:RLVR 在权重空间中沿偏离主方向进行学习,通过最小的谱漂移、减少的主子空间旋转以及偏离主方向的更新对齐来获得性能提升。相比之下,SFT 针对主权重,扭曲了频谱,甚至表现不如 RLVR。这些结果共同提供了 RLVR 训练动态的首个参数空间解释,揭示了参数演化方式的明显规律性。至关重要的是,我们表明 RL 运行在与 SFT 不同的优化机制下,因此直接适配 SFT 时代的参数高效微调 (PEFT) 方法可能存在缺陷,正如我们在高级稀疏微调和 LoRA 变体的案例研究中所展示的那样。我们希望这项工作为白盒理解 RLVR 以及设计几何感知、RLVR 原生的学习算法(而非重新利用 SFT 时代的启发式方法)指明道路。

关键词

引用

@article{arxiv.2511.08567,
  title  = {The Path Not Taken: RLVR Provably Learns Off the Principals},
  author = {Hanqing Zhu and Zhenyu Zhang and Hanxian Huang and DiJia Su and Zechun Liu and Jiawei Zhao and Igor Fedorov and Hamed Pirsiavash and Zhizhou Sha and Jinwon Lee and David Z. Pan and Zhangyang Wang and Yuandong Tian and Kai Sheng Tai},
  journal= {arXiv preprint arXiv:2511.08567},
  year   = {2025}
}

备注

Preliminary version accepted as a spotlight in NeurIPS 2025 Workshop on Efficient Reasoning