中文

RLVR 推理能力边界的争论:收缩、扩张,还是两者皆是?一个动态两阶段视角

机器学习 2025-10-07 v1 人工智能

摘要

关于强化学习可验证奖励(RLVR)是否扩大或收缩大型语言模型(LLM)推理能力的持续争论尚未得到解决。一些研究认为,RLVR主要提高采样效率,但以多样性和探索性为代价,导致能力边界收缩。相比之下,其他研究表明,长期训练可导致新颖推理策略的出现,暗示能力边界的扩张。为调和这些矛盾发现,我们在理论与实证层面表明,两个观点各自有效——分别对应内在的两阶段概率质量动态:(1)利用阶段:初始时,模型主要采样已探索的高奖励和低奖励标记,而极少选择潜在最优标记。正的优势估计增加高奖励标记的概率,降低低奖励标记的概率,但在此阶段最优标记的概率基本保持不变。(2)探索阶段:随着训练推进,已获得的高奖励标记增长率减缓,其概率趋于饱和。当潜在最优标记(即获得正的优势估计)偶尔被采样时,其概率上升,而原本的高奖励标记概率下降。这一动态表明,利用阶段的过度利用可能导致能力边界收缩,而长期训练进入探索阶段则可促进推理能力边界的扩张。基于我们的见解,我们重审仅使用相对负梯度延长训练的潜力,为开发更先进的推理能力提供了理论与实证基础。

关键词

引用

@article{arxiv.2510.04028,
  title  = {The Debate on RLVR Reasoning Capability Boundary: Shrinkage, Expansion, or Both? A Two-Stage Dynamic View},
  author = {Xinhao Yao and Lu Yu and Xiaolin Hu and Fengwei Teng and Qing Cui and Jun Zhou and Yong Liu},
  journal= {arXiv preprint arXiv:2510.04028},
  year   = {2025}
}