中文

Think-RM:在生成式奖励模型中实现长期推理

机器学习 2025-05-23 v1

摘要

从人类反馈中进行强化学习 (RLHF) 已成为一种强大的 post-training 范式,用于将大型语言模型与人类偏好相匹配。RLHF 的核心挑战在于构建准确的奖励信号,其中常用的 Bradley-Terry 奖励模型 (BT RMs) 常常受数据规模和覆盖范围的敏感性,以及对 reward hacking 的脆弱性限制。生成式奖励模型 (GenRMs) 提供了一种更稳健的替代方案,通过生成 chain-of-thought (CoT) 论证过程 followed by 最终奖励来实现。然而,现有的 GenRMs 依赖浅层、垂直扩展的推理,限制了其处理细致或复杂(例如,推理密集型)任务的能力。此外,它们的两两偏好输出与需要 pointwise 奖励信号的标准 RLHF 算法不兼容。本 work 引入 Think-RM,一种使 GenRMs 能够实现长期推理的训练框架,通过建模 internal thinking process 来实现。与生产结构化、外部提供的论证不同,Think-RM 生成灵活的、自导自驰的推理轨迹,支持自我反思、假设推理和发散推理等高级能力。为激发这些推理能力,我们首先通过在长 CoT 数据上进行监督微调 (SFT) 来进行 warm-up。随后,我们通过基于规则的强化学习 (RL) 来进一步提升模型的长期推理能力。此外,我们提出了一种新的两两 RLHF 流程,直接使用两两偏好奖励来优化策略,消除 pointwise 奖励转换的需求,更有效地利用 Think-RM 的输出。实验表明,Think-RM 在 RM-Bench 上取得最新成果,相较于 BT RM 和垂直扩展的 GenRM 性能提升 8%。当结合我们的两两 RLHF 流程时,它在 end-policy 性能方面优于传统方法。

关键词

引用

@article{arxiv.2505.16265,
  title  = {Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models},
  author = {Ilgee Hong and Changlong Yu and Liang Qiu and Weixiang Yan and Zhenghao Xu and Haoming Jiang and Qingru Zhang and Qin Lu and Xin Liu and Chao Zhang and Tuo Zhao},
  journal= {arXiv preprint arXiv:2505.16265},
  year   = {2025}
}