中文

快速-缓慢思维奖励模型:标量与生成式奖励模型的高效集成

计算与语言 2026-03-24 v1 机器学习

摘要

奖励模型(RM)是通过强化学习从人类反馈(RLHF)对大语言模型进行对齐的关键工具。虽然生成式奖励模型(GRM)通过链式思考(CoT)推理实现卓越的准确性,但其计算成本极高。相比之下,标量奖励模型(SRM)虽提供效率优势,但在复杂场景下表现受限,适应性也差。我们提出快速-缓慢思维奖励模型(F/S-RM),一种受双进程理论启发的混合RM架构。其训练目标是整合两种不同的奖励范式:以首词预测作为标量评分(快速思维),以及基于CoT的判断(缓慢思维),由双置信度激活机制调控何时激活缓慢思维。F/S-RM在保持领先模型水平的基础上,以20.8%的token消耗降低,实现了1.2%的相对性能提升。代码与数据将公开提供。

关键词

引用

@article{arxiv.2603.20212,
  title  = {Fast-Slow Thinking RM: Efficient Integration of Scalar and Generative Reward Models},
  author = {Jiayun Wu and Peixu Hou and Shan Qu and Peng Zhang and Ning Gu and Tun Lu},
  journal= {arXiv preprint arXiv:2603.20212},
  year   = {2026}
}