中文

可扩展集成方法缓解奖励过度优化

机器学习 2024-06-21 v2 计算与语言

摘要

基于人类反馈的强化学习(RLHF)使得语言模型在构建强大、遵循指令的模型方面取得了显著进展。然而,这些模型的对齐仍然是一个紧迫的挑战,因为策略倾向于在由更优的“黄金”奖励模型衡量的效用拐点之后,过度拟合所学习的“代理”奖励模型——这一现象被称为过度优化。先前的工作通过计算奖励模型集成上的悲观统计量来缓解此问题,这在离线强化学习中很常见,但对于内存需求高的语言模型而言代价极其高昂,使得此类方法对于足够大的模型不可行。为此,我们提出使用共享编码器但分离的线性头。我们发现,这种方法在实现与完整集成相似性能的同时,在训练相似规模模型时大幅节省了内存和时间。

关键词

引用

@article{arxiv.2406.01013,
  title  = {Scalable Ensembling For Mitigating Reward Overoptimisation},
  author = {Ahmed M. Ahmed and Rafael Rafailov and Stepan Sharkov and Xuechen Li and Sanmi Koyejo},
  journal= {arXiv preprint arXiv:2406.01013},
  year   = {2024}
}