无监督 RLVR 规模化 LLM 训练还能达到什么高度?
机器学习
2026-03-10 v1 计算与语言
摘要
无监督强化学习与可验证奖励 (URLVR) 为超越监督瓶颈的 LLM 训练提供了一条路径,通过无需真实标签即可获得奖励信号。近期研究利用模型内在信号表明前景,显示出可观的早期收益,但其潜力与局限性仍不清晰。本文重新审视 URLVR,提供全面的分析,涵盖分类学、理论及大量实验。我们首先根据奖励来源将 URLVR 方法分为内在型与外部型,然后建立统一的理论框架揭示所有内在方法都趋向于锐化模型初始分布。这种锐化机制在初始置信度与正确性一致时可成功,但在不一致时会灾难性失败。通过系统实验,我们发现内在奖励始终遵循“上升后下降”模式,其崩溃时机由模型先验决定,而非工程选择。尽管存在此类规模限制,我们发现内在奖励在小数据集上的测试时训练中仍具价值,并提出模型崩溃步骤用于衡量模型先验,作为 RL 训练可行性的实用指示器。最后,我们探索基于计算不对称性的外部奖励方法,初步证据表明它们可能突破置信度-正确性的天花板。我们的发现描绘了内在 URLVR 的边界,同时指引了通向可规模化替代方案的路径。
引用
@article{arxiv.2603.08660,
title = {How Far Can Unsupervised RLVR Scale LLM Training?},
author = {Bingxiang He and Yuxin Zuo and Zeyuan Liu and Shangziqi Zhao and Zixuan Fu and Junlin Yang and Cheng Qian and Kaiyan Zhang and Yuchen Fan and Ganqu Cui and Xiusi Chen and Youbang Sun and Xingtai Lv and Xuekai Zhu and Li Sheng and Ran Li and Huan-ang Gao and Yuchen Zhang and Bowen Zhou and Zhiyuan Liu and Ning Ding},
journal= {arXiv preprint arXiv:2603.08660},
year = {2026}
}
备注
Accepted to the ICLR 2026