中文

序列到序列奖励建模:通过语言反馈提升 RLHF 效果

计算与语言 2025-12-25 v2 人工智能

摘要

对大型语言模型(LLM)行为与人类意图和价值观的对齐仍是关键挑战。强化学习人类反馈(RLHF)通过在人类偏好上训练奖励模型(RM)并微调 LLM 以最大化 RM 反馈来实现对齐。尽管该方法有效且流行,但容易陷入偏向性的局部优化。这意味着 RM未能提供与人类偏好相匹配的反馈,导致 LLM探索意外的泛化,未能实现对齐目标。为缓解此问题,我们提出一种新颖的序列到序列(seq2seq)奖励建模方法。其核心思想是,从语言反馈而非标量反馈进行学习,可无需额外标注提升 RLHF 效果。我们将奖励建模目标从二元最大似然估计(MLE)替换为序列 MLE。该方法无需额外标注、模型或训练阶段,即可实现更丰富、更细粒度的语言反馈。我们的实验表明,该方法效果显著,特别是减少了单轮安全对话中的拒绝-响应范式以及文本摘要任务中长文本偏差。我们进一步分析表明,seq2seq RM 在 2B 和 7B 规模的 LLM 上针对 3 项 NLP 任务均能提升 RLHF 性能,平均获胜率达 76.9%。我们还展示了 seq2seq RM 在分布外提示下仍能提升 RLHF 效果。

关键词

引用

@article{arxiv.2409.00162,
  title  = {Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback},
  author = {Jiayi Zhou and Jiaming Ji and Juntao Dai and Dong Li and Yaodong Yang},
  journal= {arXiv preprint arXiv:2409.00162},
  year   = {2025}
}

备注

7 pages