对齐天花板:基于人类反馈强化学习中的目标失配
机器学习
2024-02-05 v2
摘要
基于人类反馈的强化学习(RLHF)已成为一种强大技术,使大语言模型(LLMs)在复杂环境中更具能力。RLHF 的流程为:收集人类偏好数据,在该数据上训练奖励模型,并针对该奖励优化基础 ML 模型以用于外在评估指标(如 MMLU、GSM8k)。RLHF 依赖于许多关于各组件如何契合的假设,例如奖励模型捕捉人类偏好,以及 RL 优化器从奖励模型中抽取正确信号。由于 RLHF 过程涉及许多独立的设计决策,很容易假设多个过程相关并因此在数值上关联。这种表面相关性常不成立,奖励模型易被过度优化,或 RL 优化器会降低未建模于数据中的任务性能。采用不完美 RLHF 系统训练的模型的显著表现是:出于安全原因拒绝基本请求,或在生成中显得懒惰。随着聊天模型评估日益精细,对奖励模型训练、RL 分数与下游性能之间感知关联的依赖引发了这些问题,我们称之为目标失配。本文阐明了该问题的成因,回顾了基于模型的强化学习的相关文献,并论证了解决方案。通过解决 RLHF 中的目标失配,未来的 ML 模型将更精确地对齐用户指令,兼顾安全性与有用性。
引用
@article{arxiv.2311.00168,
title = {The Alignment Ceiling: Objective Mismatch in Reinforcement Learning from Human Feedback},
author = {Nathan Lambert and Roberto Calandra},
journal= {arXiv preprint arXiv:2311.00168},
year = {2024}
}
备注
11 pages, 5 figures