奖励模型其实是价值函数:时序一致的奖励建模
机器学习
2026-04-28 v1
摘要
RLHF中的奖励模型仅对响应的最终token进行评分,这种选择丢弃了来自每个中间位置的丰富信号,导致模型的token级输出为噪声。我们认为这是一种被忽视的机会:一个训练良好的奖励模型在任何token上的输出应代表给定响应迄今为止所获最终奖励的条件期望。我们引入时序一致奖励建模(TCRM),通过在标准Bradley-Terry损失上添加两个正则化项来实现此属性,其最小化者可证明等于条件期望。这些正则化项对应蒙特卡罗和TD价值学习目标,建立了与RL价值函数的直接联系。TCRM无需对架构、数据或推理进行任何更改,却从一个原则中解锁了三个能力:可解释的token级奖励轨迹(中间token两两准确率从50%提升至88.9%,最终token准确率保持不变);在ProcessBench上实现最新的PRM性能(平均F1为44.9%),该模型仅基于结果数据进行训练;以及在PPO中统一奖励/价值建模,峰值GPU内存减少27%,步骤时间缩短19%,同时保持与LLM相同质量。
关键词
引用
@article{arxiv.2604.22981,
title = {Reward Models Are Secretly Value Functions: Temporally Coherent Reward Modeling},
author = {Alex Nikulkov},
journal= {arXiv preprint arXiv:2604.22981},
year = {2026}
}
备注
27 pages, 14 figures