通用奖励建模的推理时间扩展
摘要
强化学习(RL)已在大规模大型语言模型(LLM)的后训练中被广泛采用。近期,LLM 中推理能力的激励表明,适当的学习方法能够实现有效的推理时间可扩展性。RL 的一个关键挑战是在可验证问题或人工规则之外的各个领域为 LLM 获取准确的奖励信号。本文研究如何通过更多推理计算来改进通用查询的奖励建模(RM),即通用 RM 的推理时间可扩展性,并进一步研究如何通过适当的学习方法来提升性能-计算扩展的有效性。对于 RM 方法,我们采用逐点生成式奖励建模(GRM),以灵活适应不同输入类型并具备推理时间扩展的潜力。对于学习方法,我们提出自我原则批评调优(SPCT),通过在线 RL 培养 GRM 中的可扩展奖励生成行为,使其能够自适应地生成原则并准确进行批评,从而得到 DeepSeek-GRM 模型。此外,为了实现有效的推理时间扩展,我们使用并行采样来增加计算量,并引入一个元 RM 来引导投票过程以获得更好的扩展性能。实验表明,SPCT 显著提高了 GRM 的质量和可扩展性,在各种 RM 基准测试中优于现有方法和模型,且没有严重偏差,并且可以实现比训练时间扩展更好的性能。DeepSeek-GRM 在某些任务中仍面临挑战,我们相信未来在通用奖励系统方面的努力可以解决这些问题。模型已在 Hugging Face 和 ModelScope 上发布。
引用
@article{arxiv.2504.02495,
title = {Inference-Time Scaling for Generalist Reward Modeling},
author = {Zijun Liu and Peiyi Wang and Runxin Xu and Shirong Ma and Chong Ruan and Peng Li and Yang Liu and Yu Wu},
journal= {arXiv preprint arXiv:2504.02495},
year = {2025}
}
备注
Preprint, under review. 44 pages. Models are available at https://huggingface.co/collections/BBQGOD/deepseek-grm-68b4681169dbb97fd30614b5 and https://www.modelscope.cn/collections/DeepSeek-GRM-ff6a2d8babdd4a