中文

RLPR:无需验证器即可推广 RLVR 到通用领域

机器学习 2025-06-24 v1 人工智能 计算与语言

摘要

可验证奖励的强化学习(RLVR)在推动 LLM 推理能力方面显示出巨大的潜力。然而,其成功主要局限于数学和代码领域。这种主要限制源于对特定领域验证器的依赖,导致复杂度高昂且可扩展性有限。为此,我们的关键观察是,LLM 生成正确的自由形式答案的内在概率直接指示了其对推理奖励的评估(即推理过程导致正确答案的程度)。基于此洞见,我们提出了 RLPR,一个无需验证器的简单框架,将 RLVR 推广到更广泛的通用领域。RLPR 使用 LLM 对参考答案的 token 概率得分作为奖励信号,并最大化训练中的预期奖励。我们发现,解决这种噪声概率奖励的高方差是使其正常工作的关键,提出了 prob-to-reward 和稳定方法,确保从 LLM 内在概率中获得精确且稳定的奖励。广泛的实验在四个通用领域基准测试和三个数学基准测试中表明,RLPR 在 Gemma、Llama 和 Qwen 基于模型的推理能力方面均一致改进。值得注意的是,RLPR 在 TheoremQA 上以 7.6 分优势超过并行的 VeriFree,在 Minerva 上以 7.5 分优势,甚至在七个基准测试中平均超过 1.6 分的强大的验证器模型依赖方法 General-Reasoner。

关键词

引用

@article{arxiv.2506.18254,
  title  = {RLPR: Extrapolating RLVR to General Domains without Verifiers},
  author = {Tianyu Yu and Bo Ji and Shouli Wang and Shu Yao and Zefan Wang and Ganqu Cui and Lifan Yuan and Ning Ding and Yuan Yao and Zhiyuan Liu and Maosong Sun and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2506.18254},
  year   = {2025}
}

备注

Project Website: https://github.com/openbmb/RLPR