系统性验证误差对RLVR影响评估:延迟、平台期或崩溃
机器学习
2026-05-06 v1 人工智能
摘要
强化学习可验证奖励(RLVR)已成为提高大语言模型(LLM)推理能力的强大方法。虽然RLVR设计用于可验证真实答案的任务,但现实中的验证器(如静态代码检查器)会引入奖励信号的误差。先前的分析大将此类误差视为随机且独立于样本,得出误差仅减慢训练,对最终性能影响有限的结论。然而,实际验证器往往存在系统性误差。这引入了模型从结构性错误的奖励信号中学习不必要一致行为的风险。本文研究系统性验证误差对RLVR的影响。通过对算术任务进行控制实验,我们表明系统性假阴性的效果类似于随机噪声。另一方面,系统性假阳性可导致从亚最优平台期到性能崩溃的各种行为。关键的是,这些结果并非由整体错误率决定,而是由引入误差的具体模式决定,这使得事前缓解困难。我们的结果表明,与先前的结论相反,现实可行的验证误差会关键性地塑造RLVR结果,验证器的质量必须超越其样本级错误率加以理解。
引用
@article{arxiv.2605.02909,
title = {Delay, Plateau, or Collapse: Evaluating the Impact of Systematic Verification Error on RLVR},
author = {Kazuki Egashira and Mark Vero and Jasper Dekoninck and Florian E. Dorner and Robin Staab and Martin Vechev},
journal= {arXiv preprint arXiv:2605.02909},
year = {2026}
}