中文

灾难性古德哈特:用KL散度正则化RLHF无法缓解重尾奖励误设

机器学习 2024-11-11 v2

摘要

在应用基于人类反馈的强化学习(RLHF)时,奖励是从数据中学习的,因此总是存在一些误差。常见的缓解方法是用KL散度对策略进行正则化,使其偏离基础模型,期望在奖励与正则化之间取得平衡,从而在奖励误设的情况下仍能获得理想结果。我们证明,当奖励函数具有轻尾误差时,在较宽松的KL惩罚下的最优策略可以实现任意高的效用。然而,如果误差是重尾的,一些策略尽管获得的效用不超过基础模型,却能获得任意高的奖励——我们将这种现象称为灾难性古德哈特。我们采用一种离散优化方法来测量奖励模型的尾部,发现它们与轻尾误差一致。然而,重尾分布在许多现实世界应用中的普遍性表明,未来的RL奖励来源可能具有重尾误差,从而增加了即使使用KL正则化也会出现奖励黑客行为的可能性。

关键词

引用

@article{arxiv.2407.14503,
  title  = {Catastrophic Goodhart: regularizing RLHF with KL divergence does not mitigate heavy-tailed reward misspecification},
  author = {Thomas Kwa and Drake Thomas and Adrià Garriga-Alonso},
  journal= {arXiv preprint arXiv:2407.14503},
  year   = {2024}
}

备注

Mechanistic Interpretability workshop at ICML 2024; Main conference poster at NeurIPS 2024