中文

从目标层次入手探究RLVR训练不稳定性

人工智能 2026-05-13 v2

摘要

延长使用可验证奖励的强化学习(RLVR)已被证明可以持续改进大型语言模型的推理能力,但在混合专家(MoE)架构中,训练常常容易出现不稳定现象。训练不稳定严重削弱了模型能力的提升,但其根本原因和机制仍然鲜为人知。在本工作中,我们引入了一个原则化框架,通过目标层次入手来理解RLVR的不稳定性。不同于源于可验证器中可利用漏洞的奖励入手,目标层次入手源于标记层次的信用错位,表现为系统层面的伪信号在优化目标中。基于我们的框架,结合对300亿参数MoE模型的大量实验,我们追溯了病态训练动态的来源并形式化了其背后的机制:一种在MoE模型中广泛关联不稳定性却缺乏机制解释的现象——训练-推理差异的异常增长。这些发现提供了对MoE模型训练动态背后不稳定性的具体且因果的解释,为设计稳定的RLVR算法提供了指导。

关键词

引用

@article{arxiv.2602.01103,
  title  = {Probing RLVR training instability through the lens of objective-level hacking},
  author = {Yiming Dong and Kun Fu and Haoyu Li and Xinyuan Zhu and Yurou Liu and Lijing Shao and Jieping Ye and Zheng Wang},
  journal= {arXiv preprint arXiv:2602.01103},
  year   = {2026}
}

备注

Accepted by ICML 2026