中文

Libra: 通过学习思考评估和改进奖励模型

计算与语言 2025-07-30 v1

摘要

强化学习 (RL) 显著提升了大型语言模型的推理能力。然而,当前奖励模型在复杂推理场景中表现不佳,主要训练范式依赖规则驱动或参考驱动的奖励,这带来两个关键局限性:1) 依赖精细标注的参考答案才能获得奖励;2) 需要受限的输出格式。这些局限性根本阻碍了进一步的 RL 数据规模化和模型推理性能的持续提升。为此,我们提出了一套全面的框架,用于评估和改进复杂推理场景下奖励模型的性能。我们首先提出了推理导向的基准测试 (Libra Bench),系统性地构建于多样化的具有挑战性的数学问题和先进推理模型中,以弥补现有奖励模型基准在推理场景中的不足。我们进一步引入了通过学习思考方法改进生成式奖励模型的新方法。基于所提方法,我们开发了 Libra-RM 系列一组具备推理能力的生成式奖励模型,在各类基准测试中实现最先进成绩。进行了全面的下游实验,实验结果表明 Libra Bench 与下游应用之间存在相关性,Libra-RM 有望通过无标签数据进一步提升推理模型性能。

关键词

引用

@article{arxiv.2507.21645,
  title  = {Libra: Assessing and Improving Reward Model by Learning to Think},
  author = {Meng Zhou and Bei Li and Jiahao Liu and Xiaowen Shi and Yang Bai and Rongxiang Weng and Jingang Wang and Xunliang Cai},
  journal= {arXiv preprint arXiv:2507.21645},
  year   = {2025}
}

备注

Work In Progress