中文

迭代RLHF中的奖励模型过度优化

机器学习 2025-09-30 v2 人工智能 计算与语言

摘要

强化学习从人类反馈 (RLHF) 是一种广泛用于将大型语言模型与人类偏好相匹配的方法。然而,RLHF常常 suffers from 奖励模型过度优化,即模型对奖励函数过拟合,导致非通用策略,这些策略会利用奖励函数的独特性和异常现象。一种常见的缓解措施是迭代RLHF,即通过更新的人类反馈重新训练奖励模型,并重新优化策略。尽管该方法正变得越来越流行,但关于该setting下过度优化动力学的了解仍不充分。本文present了对迭代RLHF中过度优化的首个全面研究。我们系统地分析了关键设计选择——奖励模型训练数据如何在各迭代之间传递、用于优化的奖励函数是哪一个、以及策略的初始化方式。使用受控的 AlpacaFarm benchmark,我们观察到随着迭代进行,过度优化倾向于减少,因为奖励模型越来越接近ground-truth偏好。然而,随着时间推移,性能增益会逐渐下降;虽然从base policy重新初始化最为稳健,但这会限制优化的灵活性。其他初始化策略往往无法从早期过度优化中恢复。这些发现为构建更稳定和通用的RLHF pipeline提供了可操作的见解。

关键词

引用

@article{arxiv.2505.18126,
  title  = {Reward Model Overoptimisation in Iterated RLHF},
  author = {Lorenz Wolf and Robert Kirk and Mirco Musolesi},
  journal= {arXiv preprint arXiv:2505.18126},
  year   = {2025}
}

备注

24 pages, 17 figures, 6 tables