中文

不完美的验证器足够好:基于噪声奖励的学习

机器学习 2026-04-10 v1 人工智能

摘要

基于可验证奖励的强化学习 (RLVR) 已成为后训练大型语言模型 (LLM) 的热门方法。然而,验证器很少是完美无误的;即便是确定性检查也可能不准确,越来越依赖基于模型的裁判也加剧了这一问题。RLVR 对此类噪声的鲁棒性以及何种验证器准确率才能实现有效训练仍是未解之谜。本文通过向 RL 训练中引入噪声来探讨这些问题,分别在代码生成和科学推理领域进行研究。噪声率最高可达 15% 时,峰值验证准确率在干净基线之内仅低于 2 个百分点。这些发现在受控噪声和基于模型的噪声类型、三个模型家族 (Qwen3、GLM4、Llama 3.1) 以及模型规模从 4B 到 9B 之间保持一致。总体而言,结果表明不完美的验证并不构成 RLVR 的根本性障碍。此外,我们的发现表明,实践者应优先考虑具有高精度的中等准确率,而非完美的验证。

关键词

引用

@article{arxiv.2604.07666,
  title  = {An Imperfect Verifier is Good Enough: Learning with Noisy Rewards},
  author = {Andreas Plesner and Francisco Guzmán and Anish Athalye},
  journal= {arXiv preprint arXiv:2604.07666},
  year   = {2026}
}