您的语言模型为何是差的隐式奖励模型?
计算与语言
2026-01-28 v3 人工智能
机器学习
机器学习
摘要
奖励模型是语言模型后训练和推理管道中的关键组件。方便的是,最近的工作表明,每个语言模型都定义了一个隐式奖励模型(IM-RM),无需进行任何架构更改。然而,此类IM-RM倾向于在分布外(out-of-distribution)方面 generalization 能力较差,尤其是相较于应用专用线性头的显式奖励模型(EX-RM)。前者在奖励计算方式上几乎与后者相同,但却存在 generalization 差距,这一现象颇具 puzzles。鉴于EX-RM和IM-RM几乎相同,可以使用相同的数据、损失函数和语言模型训练,仅在奖励计算方式上存在差异,我们调查了这种差距的根本原因。我们的主要发现得到理论和实验的支持,表明IM-RM更依赖于表面级别的token级线索。因此,在token级分布迁移以及分布内情境下,IM-RM往往 generalization 能力较差。此外,我们提供了对备选假设的证据,驳斥了IM-RM在生成难于验证的任务中表现不佳的说法,因为它们既可作为验证器也可作为生成器。总体而言,我们的结果表明,看似微小的设计选择会显著影响奖励模型的 generalization 行为。
引用
@article{arxiv.2507.07981,
title = {Why is Your Language Model a Poor Implicit Reward Model?},
author = {Noam Razin and Yong Lin and Jiarui Yao and Sanjeev Arora},
journal= {arXiv preprint arXiv:2507.07981},
year = {2026}
}
备注
Accepted to ICLR 2026; Code available at https://github.com/princeton-pli/exrm-vs-imrm