中文

奖励(不)一致性对RLHF的滴漏式影响

计算与语言 2023-09-29 v1 机器学习

摘要

基于人类反馈的强化学习(RLHF)的标准做法是对抗奖励模型(RM)进行优化,而该RM本身被训练以反映人类对期望生成内容的偏好。一个研究不足的重要问题是RM的(不)一致性——即它们能否识别不同提示的语义变化并恰当地调整其奖励分配——及其对下游RLHF模型的影响。本文中,我们探讨一系列与RM不一致性相关的研究问题:(1) 如何度量奖励模型的一致性?(2) 现有RM的一致性如何,我们又该如何改进?(3) 奖励不一致性以何种方式影响由RLHF模型训练得到的聊天机器人?我们提出Contrast Instructions——一种针对RM一致性的基准测试策略。Contrast Instructions中每个示例包含一对词法相似但真实响应不同的指令。一致的RM应将该指令与对应响应排在其它组合之前。我们观察到,与普通人相比,以标准排序目标训练的当前RM在Contrast Instructions上表现极差。为表明RM一致性可在不使用额外训练预算的情况下高效提升,我们提出ConvexDA与RewardFusion两种技术,分别通过在RM训练与推理阶段的推断来增强奖励一致性。我们表明,以更一致的RM训练的RLHF模型产生更有用的响应,说明奖励不一致性对下游RLHF过程具有滴漏效应。

关键词

引用

@article{arxiv.2309.16155,
  title  = {The Trickle-down Impact of Reward (In-)consistency on RLHF},
  author = {Lingfeng Shen and Sihao Chen and Linfeng Song and Lifeng Jin and Baolin Peng and Haitao Mi and Daniel Khashabi and Dong Yu},
  journal= {arXiv preprint arXiv:2309.16155},
  year   = {2023}
}