中文

对齐天花板:基于人类反馈强化学习中的目标失配

机器学习 2024-02-05 v2

摘要

基于人类反馈的强化学习(RLHF)已成为一种强大技术,使大语言模型(LLMs)在复杂环境中更具能力。RLHF 的流程为:收集人类偏好数据,在该数据上训练奖励模型,并针对该奖励优化基础 ML 模型以用于外在评估指标(如 MMLU、GSM8k)。RLHF 依赖于许多关于各组件如何契合的假设,例如奖励模型捕捉人类偏好,以及 RL 优化器从奖励模型中抽取正确信号。由于 RLHF 过程涉及许多独立的设计决策,很容易假设多个过程相关并因此在数值上关联。这种表面相关性常不成立,奖励模型易被过度优化,或 RL 优化器会降低未建模于数据中的任务性能。采用不完美 RLHF 系统训练的模型的显著表现是:出于安全原因拒绝基本请求,或在生成中显得懒惰。随着聊天模型评估日益精细,对奖励模型训练、RL 分数与下游性能之间感知关联的依赖引发了这些问题,我们称之为目标失配。本文阐明了该问题的成因,回顾了基于模型的强化学习的相关文献,并论证了解决方案。通过解决 RLHF 中的目标失配,未来的 ML 模型将更精确地对齐用户指令,兼顾安全性与有用性。

关键词

引用

@article{arxiv.2311.00168,
  title  = {The Alignment Ceiling: Objective Mismatch in Reinforcement Learning from Human Feedback},
  author = {Nathan Lambert and Roberto Calandra},
  journal= {arXiv preprint arXiv:2311.00168},
  year   = {2024}
}

备注

11 pages, 5 figures