Agentic 奖励建模:集成可验证正确性信号以提升奖励系统可靠性
计算与语言
2025-02-27 v1 人工智能
摘要
奖励模型(RM)是大型语言模型(LLM)训练及推理时间扩展的关键。然而,现有奖励模型主要关注人类偏好,忽略了在训练 LLM 中显示出强大潜力的可验证正确性信号。本文提出了 agentic 奖励建模,即一种将奖励模型与来自不同方面的可验证正确性信号相结合,以提供可靠奖励的奖励系统。我们经验性地实现了一个奖励代理,名为 RewardAgent,该代理将人类偏好奖励与两种可验证信号(事实性和指令遵循)相结合,以提供更可靠的奖励。我们在现有奖励模型基准测试和针对真实下游任务的推理时间最佳搜索中进行了全面实验。RewardAgent 显著优于普通奖励模型,显示其有效性。我们进一步使用 RewardAgent 构建训练偏好对,并基于 DPO 目标训练 LLM,在各种 NLP 基准测试中实现优异性能。我们的代码已公开发布以促进进一步研究(https://github.com/THU-KEG/Agentic-Reward-Modeling)。
关键词
引用
@article{arxiv.2502.19328,
title = {Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems},
author = {Hao Peng and Yunjia Qi and Xiaozhi Wang and Zijun Yao and Bin Xu and Lei Hou and Juanzi Li},
journal= {arXiv preprint arXiv:2502.19328},
year = {2025}
}
备注
16 pages, 5 figures