中文

速率还是命运?RLV$\varepsilon$R:可验证噪声强化学习

机器学习 2026-01-09 v1 人工智能 计算与语言

摘要

可验证奖励(RLVR)的强化学习是一种简单却强大的LLM训练范式:抽取一个完成方案,验证其有效性,然后进行更新。然而,实际应用中,验证器几乎总是不完美的——单元测试仅探测有限的边界情况;人类和合成标签不完美;LLM评估器(如RLAIF)噪声且可能被利用——而且在更难的领域(尤其是编程)中,问题更加严重,其中测试稀疏且日益由模型生成。我们提出一个务实的问题:验证噪声是否仅减慢学习速度(rate),或会改变最终结果(fate)?为此,我们发展了一个可分析的多臂老虎机视角下的RLVR动力学,采用GRPO方法并在受控实验中进行验证。我们将误报和漏报建模,并将完成方案归类为不断出现的推理模式,yield出一种类似复制者(自然选择)流程在概率单纯形上的演化。该动力学分解为正确模式内部的竞争以及一个关于错误模式质量的一维演化,其漂移仅由Youden指数 J=TPRFPRJ=TPR-FPR 决定。这导致一个尖锐的相位转变:当 J>0J>0 时,错误质量被驱向消亡(学习);当 J=0J=0 时,过程为中性;当 J<0J<0 时,错误模式将扩大直至主导(反向学习和崩溃)。在学习 regime J>0J>0 中,噪声主要重新缩放收敛时间(“速率,而非命运”)。在合成噪声下进行可验证编程任务的实验复现了 J=0J=0 的边界。除了噪声,该框架为分析RLVR的稳定性、收敛性以及算法干预提供了一种通用视角。

关键词

引用

@article{arxiv.2601.04411,
  title  = {Rate or Fate? RLV$^\varepsilon$R: Reinforcement Learning with Verifiable Noisy Rewards},
  author = {Ali Rad and Khashayar Filom and Darioush Keivan and Peyman Mohajerin Esfahani and Ehsan Kamalinejad},
  journal= {arXiv preprint arXiv:2601.04411},
  year   = {2026}
}