中文

使用对比奖励改进基于人类反馈的强化学习

计算与语言 2024-03-15 v2 人工智能

摘要

基于人类反馈的强化学习 (RLHF) 是用于使大型语言模型 (LLMs) 与人类偏好对齐的主流范式。然而,现有的 RLHF 严重依赖准确且信息丰富的奖励模型,这些模型容易受到来自各种来源(例如人类标注错误)的噪声影响,使得该流程变得脆弱。在这项工作中,我们通过在奖励上引入一个惩罚项来提高奖励模型的有效性,该惩罚项被称为 \textit{对比奖励}。我们的方法包括两个步骤:(1) 离线采样步骤,获取对提示的响应以作为基线计算;(2) 使用基线响应计算对比奖励,并将其用于近端策略优化 (PPO) 步骤。我们表明,对比奖励使 LLM 能够惩罚奖励不确定性、提高鲁棒性、鼓励在基线之上进行改进、根据任务难度进行校准,并降低 PPO 中的方差。我们通过实验表明,对比奖励可以大幅改进 RLHF,这一点通过 GPT 和人类评估均得到了验证,并且我们的方法始终优于强基线。

关键词

引用

@article{arxiv.2403.07708,
  title  = {Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards},
  author = {Wei Shen and Xiaoying Zhang and Yuanshun Yao and Rui Zheng and Hongyi Guo and Yang Liu},
  journal= {arXiv preprint arXiv:2403.07708},
  year   = {2024}
}