中文

奖励模型过度优化的缩放定律

机器学习 2022-10-20 v1 机器学习

摘要

在基于人类反馈的强化学习中,通常会针对一个训练用于预测人类偏好的奖励模型进行优化。由于奖励模型是不完美的代理,过度优化其价值会损害真实性能,这符合古德哈特定律。该效应已被频繁观察到,但因收集人类偏好数据的代价高昂而未得到细致度量。在本工作中,我们使用一种合成设定,其中一个固定的“金标准”奖励模型扮演人类角色,提供用于训练代理奖励模型的标签。我们研究当我们使用强化学习或 best-of-nn 采样针对代理奖励模型进行优化时,金标准奖励模型分数如何变化。我们发现这种关系遵循不同的函数形式,取决于优化方法,且在两种情况下其系数都随奖励模型参数量平滑缩放。我们还研究了奖励模型数据集大小、奖励模型与策略参数量,以及强化学习设定中加于奖励的 KL 惩罚系数对该关系的影响。我们探讨了这些经验结果对 AI 对齐中理论考量之意涵。

关键词

引用

@article{arxiv.2210.10760,
  title  = {Scaling Laws for Reward Model Overoptimization},
  author = {Leo Gao and John Schulman and Jacob Hilton},
  journal= {arXiv preprint arXiv:2210.10760},
  year   = {2022}
}