中文

从准确率到鲁棒性:数学推理中基于规则与基于模型的验证器研究

机器学习 2025-10-08 v2 人工智能 计算与语言

摘要

可信的验证器对于可验证奖励强化学习 (RLVR) 的成功至关重要,而 RLVR 是 DeepSeek-R1 等各种大型推理模型背后的核心方法。在数学推理等复杂领域,以往的工作广泛采用基于规则的验证器来训练强大的推理模型。然而,这些验证器的可靠性及其对 RL 训练过程的影响仍不清楚。在这项工作中,我们以数学推理为案例研究,在静态评估和 RL 训练场景下对各种验证器进行了全面分析。首先,我们发现当前开源的基于规则的验证器通常无法在多个常用数学数据集中识别以不同格式呈现的等价答案,导致不可忽视的假阴性率。这一局限性对 RL 训练性能产生了不利影响,并且随着策略模型变强而变得更加明显。随后,我们研究了基于模型的验证器作为解决这些局限性的潜在方案。虽然静态评估表明基于模型的验证器实现了显著更高的验证准确率,但进一步的分析和 RL 结果表明它们极易受到 hacking 的影响,即将响应中的某些模式误判为正确,尤其是在微调之后。这种脆弱性在策略模型优化期间被利用,导致人为虚高的奖励。我们的发现强调了基于规则和基于模型的验证器所固有的独特挑战,并为开发更准确、更鲁棒的强化学习奖励系统提供了见解。

关键词

引用

@article{arxiv.2505.22203,
  title  = {From Accuracy to Robustness: A Study of Rule- and Model-based Verifiers in Mathematical Reasoning},
  author = {Yuzhen Huang and Weihao Zeng and Xingshan Zeng and Qi Zhu and Junxian He},
  journal= {arXiv preprint arXiv:2505.22203},
  year   = {2025}
}