从目标层次入手探究RLVR训练不稳定性
人工智能
2026-05-13 v2
摘要
延长使用可验证奖励的强化学习(RLVR)已被证明可以持续改进大型语言模型的推理能力,但在混合专家(MoE)架构中,训练常常容易出现不稳定现象。训练不稳定严重削弱了模型能力的提升,但其根本原因和机制仍然鲜为人知。在本工作中,我们引入了一个原则化框架,通过目标层次入手来理解RLVR的不稳定性。不同于源于可验证器中可利用漏洞的奖励入手,目标层次入手源于标记层次的信用错位,表现为系统层面的伪信号在优化目标中。基于我们的框架,结合对300亿参数MoE模型的大量实验,我们追溯了病态训练动态的来源并形式化了其背后的机制:一种在MoE模型中广泛关联不稳定性却缺乏机制解释的现象——训练-推理差异的异常增长。这些发现提供了对MoE模型训练动态背后不稳定性的具体且因果的解释,为设计稳定的RLVR算法提供了指导。
引用
@article{arxiv.2602.01103,
title = {Probing RLVR training instability through the lens of objective-level hacking},
author = {Yiming Dong and Kun Fu and Haoyu Li and Xinyuan Zhu and Yurou Liu and Lijing Shao and Jieping Ye and Zheng Wang},
journal= {arXiv preprint arXiv:2602.01103},
year = {2026}
}
备注
Accepted by ICML 2026