中文

通过评分标准促进奖励与引导:提高多领域推理能力

人工智能 2025-11-20 v2

摘要

近期强化学习(RL)的进展显著提升了大型语言模型(LLM)的复杂推理能力。尽管取得这些成功,但现有方法主要聚焦于单一领域的强化学习(如数学),且依赖可验证奖励的RL(RLVR),其依赖纯在线RL框架限制了探索空间,从而限制了推理性能。在本文中,我们通过利用评分标准提供细粒度奖励信号和离线引导来克服这些限制。我们提出了一种基于评分标准的强化学习框架,用于多领域推理,称为 RGR-GRPO(Reward and Guidance through Rubrics)。RGR-GRPO 使 LLM 在进行 GRPO 训练时能够接收到稠密且有信息量的奖励,并探索更大的解空间。跨越 14 个基准测试的广泛实验表明,RGR-GRPO 在依赖单一奖励方案或离线引导的 RL 方法之上始终表现出色。在数学、物理、化学和一般推理任务上,RGR-GRPO 分别相对于可验证的在线 RL 基线实现了平均提升幅度为 +7.0%、+5.4%、+8.4% 和 +6.6%。值得注意的是,RGR-GRPO 在离政策训练期间保持稳定的熵波动,并实现了卓越的 pass@k 性能,这反映出持续的探索以及超越现有性能瓶颈的有效突破。

关键词

引用

@article{arxiv.2511.12344,
  title  = {Reward and Guidance through Rubrics: Promoting Exploration to Improve Multi-Domain Reasoning},
  author = {Baolong Bi and Shenghua Liu and Yiwei Wang and Siqian Tong and Lingrui Mei and Yuyao Ge and Yilong Xu and Jiafeng Guo and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2511.12344},
  year   = {2025}
}