中文

隐形项圈:RLVR 是否可能摆脱其起源

机器学习 2026-02-05 v4 人工智能 计算与语言

摘要

近期进展表明,基于可验证奖励的强化学习 (RLVR) 是增强大语言模型能力的有前景的方法。然而,当前 RLVR 实践是否真正扩展了模型的推理边界,或仅放大了基础模型已知的高奖励输出以提高精度性,仍不明确。本研究提供了一项实证调查,为理解 RLVR 的局限性提供了新的见解。我们考察了 RLVR 如何作为受限优化机制,可能限制发现全新解答的能力,仍受制于基础模型初始分布。我们还识别出熵-奖励之间的权衡:尽管 RLVR 可靠地提高了精度,但可能逐渐缩小探索范围,潜在地忽略正确但被低估的解答。大量实证实验验证表明,尽管 RLVR 持续提高 \texttt{pass@1} 指标,但在更大的抽样预算下,经验支持的收缩通常超过经验支持的扩大,未能恢复基础模型先前可达到的正确答案。有趣的是,尽管 RLVR 有时会增加 token 级别的熵,但其在每个生成步骤上的不确定性增加,答案级别的熵则呈下降趋势。这表明,这些看似更不确定的路径最终收敛到更小的离散答案集合。综上所述,我们揭示了 RLVR 在扩展推理视野方面的潜在局限。摆脱这根看不见的项圈需要未来的创新,通过为被低估的解答区域注入概率质量来实现。

关键词

引用

@article{arxiv.2507.14843,
  title  = {The Invisible Leash: Why RLVR May or May Not Escape Its Origin},
  author = {Fang Wu and Weihao Xuan and Ximing Lu and Mingjie Liu and Yi Dong and Zaid Harchaoui and Yejin Choi},
  journal= {arXiv preprint arXiv:2507.14843},
  year   = {2026}
}