中文

可验证奖励强化学习中的噪声数据具有破坏性

机器学习 2026-03-18 v1

摘要

可验证奖励的强化学习 (RLVR) 已推动大型语言模型在各个领域的最新能力进步。最近的研究表明,改进的 RLVR 算法允许模型从错误标注的数据中有效学习,性能可与从干净数据中学习相当。本文指出,这些发现是无效的,因为声称的 100% 噪声训练数据实际上被"干净"数据所污染。经过严格的重新验证管道校正后的数据集,我们展示了噪声数据对 RLVR 是有害的。我们表明,现有的 RLVR 算法改进无法减轻噪声的影响, achieving performance similar to that of the basic GRPO. 此外,我们发现,在数学推理基准测试中,训练在真正错误标注数据上的模型性能比在干净数据上训练的模型差 8-10%。最后,我们在 Text2SQL 任务中验证了这些发现,训练在真实世界人工标注错误数据上的模型,其准确率比干净数据低 5-12%。我们的结果表明,当前的 RLVR 方法尚不能抵消差数据的影响。高质量数据仍至关重要。

关键词

引用

@article{arxiv.2603.16140,
  title  = {Noisy Data is Destructive to Reinforcement Learning with Verifiable Rewards},
  author = {Yuxuan Zhu and Daniel Kang},
  journal= {arXiv preprint arXiv:2603.16140},
  year   = {2026}
}

备注

16 pages, 17 figures