用约束RLHF应对奖励模型过优化
机器学习
2023-10-11 v2 人工智能
摘要
大语言模型通常通过优化拟合人类反馈的(RMs)来与人类偏好对齐。然而,人类偏好是多面的,并且越来越常见的是从多个更简单的奖励模型组合中导出奖励,每个模型捕捉语言质量的一个不同方面。这本身带来了挑战,因为在组合这些分量RM时难以适当加权。更棘手的是,由于任何RM都只是人类评估的代理,该过程易受影响,即在某一点之后,累积更高奖励反而与人类评分变差相关。在本文中,我们进行了据我们所知首个关于复合RM中过优化的研究,表明分量RM之间的相关性对这些转折点的位置有显著影响。然后我们引入一种方法,使用约束强化学习来解决此问题,以防止智能体超过每个RM的有用性阈值。我们的方法通过学习动态权重(自然地由拉格朗日乘子表示)来解决分量RM的加权问题。结果,每个RM都保持在作为有效代理的范围内,提升了评估性能。最后,我们引入一种使用无梯度优化的自适应方法,在单次运行中识别并优化朝向这些点。
引用
@article{arxiv.2310.04373,
title = {Confronting Reward Model Overoptimization with Constrained RLHF},
author = {Ted Moskovitz and Aaditya K. Singh and DJ Strouse and Tuomas Sandholm and Ruslan Salakhutdinov and Anca D. Dragan and Stephen McAleer},
journal= {arXiv preprint arXiv:2310.04373},
year = {2023}
}