句子级奖励模型可更好地用于人类偏好对齐 LLM
计算与语言
2025-06-12 v4 机器学习
摘要
从人类偏好数据集中学习奖励模型并随后通过强化学习优化语言模型,已成为一种将 LLM 对齐人类偏好的基本范式。奖励模型的性能在对齐效果中起关键作用。以往的奖励模型 operate at a coarse-grained level,需要生成完整响应才能获得奖励值。稀疏奖励可能给下游强化学习带来挑战。虽然近期努力尝试学习 token 级奖励模型,但缺乏显式语义信息使其难以为每个 individual token 建模信用。本文提出为每个句子分配得分,引入一种中间粒度奖励模型。通过将完整响应分割为句子并对每个句子的起始和结束位置进行差分操作,我们能够有效地为句子建模奖励。此外,引入一种新型注意力机制,将所有句子的得分聚合为响应级别的得分,从而允许其使用 Bradley-Terry 模型进行训练。在常用基准测试中,我们的方法在 RewardBench(奖励建模评估)上比响应级别奖励模型提升 2.7%,并在 AlpacaEval(对齐评估)上超越所有基线。
关键词
引用
@article{arxiv.2503.04793,
title = {Sentence-level Reward Model can Generalize Better for Aligning LLM from Human Preference},
author = {Wenjie Qiu and Yi-Chen Li and Xuqin Zhang and Tianyi Zhang and Yihang Zhang and Zongzhang Zhang and Yang Yu},
journal= {arXiv preprint arXiv:2503.04793},
year = {2025}
}