中文

奖励建模中的轨迹内一致性

机器学习 2025-06-17 v3 人工智能

摘要

奖励模型对于提升大语言模型(LLMs)至关重要,特别是在基于人类反馈的强化学习(RLHF)或推理时验证中。当前奖励建模通常依赖整体响应的分数来学习响应的结果奖励。然而,由于响应级别的分数是粗粒度的监督信号,奖励模型难以识别响应轨迹中真正与分数相关的特定组件,导致在未见响应上的泛化能力较差。在本文中,我们提出利用生成概率来建立响应轨迹中各过程之间的奖励一致性,从而使响应级别的监督信号跨过程传播,为奖励学习提供额外的细粒度信号。基于贝叶斯框架的分析,我们开发了轨迹内一致性正则化,以强制相邻过程在具有更高下一个token生成概率时保持更一致的奖励。我们将提出的正则化应用于先进的结果奖励模型,提升了其在RewardBench上的性能。此外,我们证明使用所提出正则化训练的奖励模型能够诱导更好的DPO对齐策略,并取得更优的best-of-N(BON)推理时验证结果。我们的代码发布在 https://github.com/chaoyang101/ICRM。

关键词

引用

@article{arxiv.2506.09096,
  title  = {Intra-Trajectory Consistency for Reward Modeling},
  author = {Chaoyang Zhou and Shunyu Liu and Zengmao Wang and Di Wang and Rong-Cheng Tu and Bo Du and Dacheng Tao},
  journal= {arXiv preprint arXiv:2506.09096},
  year   = {2025}
}

备注

Under review