将价值重新纳入RL:统一LLM推理者与验证者以实现更好的测试时扩展
机器学习
2026-04-14 v2 人工智能
摘要
普遍的强化学习(RL)方法用于微调LLM推理器,如GRPO或Leave-one-out PPO,放弃了所学价值函数以依赖经验估计的回报。这会阻碍依赖价值函数进行验证的测试时计算扩展。然而,如果并行测试时计算已经是部署计划的一部分,那么训练应设计为支持它。在本文中,我们提出了RL通过在RL生成的数据上联合训练LLM作为推理器和生成式验证器来扩展任何“无价值”RL方法,添加验证功能而不会产生显著的额外开销。经验上,RL通过并行抽样将MATH准确率提高了超过20%,并使的测试时计算扩展比基本RL方法更高效。RL还在easy-to-hard和跨域任务中表现出强大的泛化能力。此外,RL在联合扩展并行和顺序测试时计算时,与长推理R1模型相比实现的更高性能。更广泛地,RL实现了测试时扩展的协训练原则:使用RL训练已产生的数据,联合优化任务性能和推理时有用的能力。
引用
@article{arxiv.2505.04842,
title = {Putting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With Verifiers},
author = {Kusha Sareen and Morgane M Moss and Alessandro Sordoni and Rishabh Agarwal and Arian Hosseini},
journal= {arXiv preprint arXiv:2505.04842},
year = {2026}
}