中文

你只需要最少的 RLVR 训练:通过秩-1 轨迹进行 LLM 的外推

机器学习 2026-05-21 v1 计算与语言

摘要

从可验证奖励进行的强化学习 (RLVR) 已成为提高大型语言模型 (LLM) 推理能力的主导范式,但其所产生参数轨迹的几何结构仍未得到充分探索。在本工作中,我们证明了 RLVR 权重轨迹是极其低秩且高度可预测的。具体而言,我们发现下游性能提升的主要部分由参数 delta 的秩-1 近似所捕获,其中该投影的大小在训练步骤数方面趋近于线性演化。基于此,我们提出了一种简单且计算高效的方法 RELEX (REinforcement Learning EXtrapolation),该方法从短暂的观察窗口中估计秩-1 子空间,并通过线性回归外推未来的检查点,无需学习模型。在三个模型 (Qwen2.5-Math-1.5B、Qwen3-4B-Base 和 Qwen3-8B-Base) 上,RELEX 产生的检查点在域内和域外基准测试中表现出与 RLVR 相同或更好的性能,仅需完成完整 RLVR 训练的 15% 的步骤。令人惊讶的是,RELEX 能够在无需训练的情况下将外推远超观察窗口,例如仅观察前 50 步即可外推到 1000 步,并持续实现性能提升。我们的消融分析确认了 RELEX 的最小主义充分性:无需增加子空间的秩,也无需采用非线性建模,即可在外推中获得进一步的提升。最后,我们表明 RELEX 的成功源于一种“去噪”效果:通过将更新投影到秩-1 子空间,模型会丢弃会在外推期间导致性能下降的随机优化噪声。我们的代码可在 https://github.com/weizhepei/RELEX 上获取。

关键词

引用

@article{arxiv.2605.21468,
  title  = {You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories},
  author = {Zhepei Wei and Xinyu Zhu and Wei-Lin Chen and Chengsong Huang and Jiaxin Huang and Yu Meng},
  journal= {arXiv preprint arXiv:2605.21468},
  year   = {2026}
}

备注

preprint. Code: https://github.com/weizhepei/RELEX