奖励模型过度优化的缩放定律
机器学习
2022-10-20 v1 机器学习
摘要
在基于人类反馈的强化学习中,通常会针对一个训练用于预测人类偏好的奖励模型进行优化。由于奖励模型是不完美的代理,过度优化其价值会损害真实性能,这符合古德哈特定律。该效应已被频繁观察到,但因收集人类偏好数据的代价高昂而未得到细致度量。在本工作中,我们使用一种合成设定,其中一个固定的“金标准”奖励模型扮演人类角色,提供用于训练代理奖励模型的标签。我们研究当我们使用强化学习或 best-of- 采样针对代理奖励模型进行优化时,金标准奖励模型分数如何变化。我们发现这种关系遵循不同的函数形式,取决于优化方法,且在两种情况下其系数都随奖励模型参数量平滑缩放。我们还研究了奖励模型数据集大小、奖励模型与策略参数量,以及强化学习设定中加于奖励的 KL 惩罚系数对该关系的影响。我们探讨了这些经验结果对 AI 对齐中理论考量之意涵。
引用
@article{arxiv.2210.10760,
title = {Scaling Laws for Reward Model Overoptimization},
author = {Leo Gao and John Schulman and Jacob Hilton},
journal= {arXiv preprint arXiv:2210.10760},
year = {2022}
}