中文

大语言模型 RLVR 训练中的线性动力学

机器学习 2026-05-22 v3 计算与语言

摘要

带有可验证奖励的强化学习(RLVR)在面向推理的大型语言模型(LLM)中带来了显著的性能提升,但其内部训练动力学在很大程度上仍是一个黑盒。在这项工作中,我们对 RLVR 进行了全面的轨迹级分析,并发现了一个惊人的规律:跨越不同的模型家族、RL 算法和训练配置,RLVR 一致地进入一个鲁棒的线性区间,其中参数权重和输出对数概率(通过教师强制评估进行严格测量)均以高度线性的方式演化(R2>0.7R^2 > 0.7)。通过受控实验和理论分析,我们证明这种线性并非巧合,而是源于 RLVR 训练信号的高方差、嘈杂的特性,该特性充当了低通滤波器,将优化集中在稳定、低维的漂移上。此外,我们表明这种线性结构不仅仅是描述性的,而且具有强大的预测性和可操作性。具体而言,权重空间外推匹配了标准 RL 优化的性能,同时通过周期性重新基准化实现了 6.1 倍的训练加速。同时,输出空间外推作为一种轻量级干预,有效避免了后期模型崩溃,在数学和编程基准上始终优于标准 RL,平均性能提升 4.2%。我们的代码可在 https://github.com/Miaow-Lab/RLVR-Linearity 获取。

关键词

引用

@article{arxiv.2601.04537,
  title  = {Linear Dynamics in the RLVR Training of Large Language Models},
  author = {Tianle Wang and Jiayu Liu and Zhongyuan Wu and Shenghao Jin and Wei Chen and Hao Xu and Ning Miao},
  journal= {arXiv preprint arXiv:2601.04537},
  year   = {2026}
}

备注

Major revision: substantially reorganized the manuscript and added a theoretical explanation section. The replacement is intended for the same arXiv paper; the core topic and contribution remain the same