中文

RED:通过奖励重分配从整体反馈中释放Token级奖励

计算与语言 2025-09-12 v2 人工智能

摘要

基于人类反馈的强化学习(RLHF)为将大型语言模型(LLM)与人类偏好对齐提供了一种有前景的方法。通常,在强化训练阶段,会训练或提供一个奖励模型来充当人类的代理,以评估生成的响应。然而,当前的奖励模型作为序列到单点的模型运行,为整个输出序列分配一个单一、稀疏且延迟的奖励。这种方法可能忽略了单个Token对期望结果的显著贡献。为此,我们提出了一种更细粒度的、Token级别的指导方法用于强化学习训练。具体来说,我们引入了RED,这是一种新颖的奖励重分配方法,它利用现成的奖励模型评估并为每个Token分配具体的贡献度。利用这些细粒度的奖励增强了模型对语言细微差别的理解,从而带来更精确的性能提升。值得注意的是,我们的方法不需要修改奖励模型或引入额外的训练步骤,因此产生的计算成本极低。在多种数据集和任务上的实验结果证明了我们方法的优越性。

关键词

引用

@article{arxiv.2411.08302,
  title  = {RED: Unleashing Token-Level Rewards from Holistic Feedback via Reward Redistribution},
  author = {Jiahui Li and Lin Li and Tai-wei Chang and Kun Kuang and Long Chen and Jun Zhou and Cheng Yang},
  journal= {arXiv preprint arXiv:2411.08302},
  year   = {2025}
}