OpenReward:通过强化学习学习长期代理任务的奖励模型
计算与语言
2025-10-30 v2
摘要
奖励模型(RM)已成为大型语言模型(LLM)对齐的关键组件,既在训练中又在推理中,充当了人类评估的可扩展代理。然而,现有奖励模型在知识密集型和长期任务方面存在挑战,因这些任务的正确性评估需要超出模型内部知识的 grounding。这一限制阻碍了它们可靠地判别细微的质量差异,尤其是在需要外部证据时。为此,我们引入 OpenRM,这是一个带工具的长期奖励模型,通过调用外部工具来收集相关证据,从而系统性地判断开放性响应。我们在超过 27,000 个合成的两两示例上使用群体相对策略优化(GRPO)训练 OpenRM。训练目标联合监督中间工具使用和最终结果准确性,以激励我们的奖励模型学习有效的基于证据的判决策略。在三个新收集的数据集和两个广泛使用的基准测试上的大量实验表明,OpenRM 在现有奖励建模方法上显著优于表现。进一步地,我们将 OpenRM 集成到推理时响应选择和训练时数据选择中。这在下游 LLM 对齐任务中实现了持续的性能提升,凸显了带工具奖励模型在扩大可靠长期评估方面的潜力。
引用
@article{arxiv.2510.24636,
title = {OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning},
author = {Ziyou Hu and Zhengliang Shi and Minghang Zhu and Haitao Li and Teng Sun and Pengjie Ren and Suzan Verberne and Zhaochun Ren},
journal= {arXiv preprint arXiv:2510.24636},
year = {2025}
}