中文

奖励模型集成有助于缓解过度优化

机器学习 2024-03-12 v2

摘要

基于人类反馈的强化学习(RLHF)是将大语言模型微调以遵循指令的标准方法。在此过程中,习得奖励模型被用于近似建模人类偏好。然而,作为“真实”奖励的不完美表征,这些习得奖励模型易受过度优化影响。Gao 等人(2023)在合成人类反馈设定中研究了该现象,使用一个显著更大的“黄金”奖励模型作为真实奖励(而非人类),并表明无论代理奖励模型规模与所用训练数据如何,过度优化仍是一个持续存在的问题。使用类似设定,我们开展系统研究,评估在使用两种优化方法时,基于集成的保守优化目标(具体而言为最坏情况优化(WCO)与不确定性加权优化(UWO))缓解奖励模型过度优化的有效性:(a)best-of-n 采样(BoN);(b)近端策略优化(PPO)。我们还将 Gao 等人(2023)的设定扩展至包含 25% 标签噪声,以更好地反映真实条件。无论有无标签噪声,我们发现保守优化几乎消除了过度优化,并使 BoN 采样性能提升高达 70%。对于 PPO,基于集成的保守优化始终减少过度优化,并优于单一奖励模型优化。此外,将其与较小的 KL 惩罚结合可成功防止过度优化且无需性能代价。总体而言,我们的结果表明基于集成的保守优化能有效对抗过度优化。

关键词

引用

@article{arxiv.2310.02743,
  title  = {Reward Model Ensembles Help Mitigate Overoptimization},
  author = {Thomas Coste and Usman Anwar and Robert Kirk and David Krueger},
  journal= {arXiv preprint arXiv:2310.02743},
  year   = {2024}
}

备注

Accepted at ICLR 2024