中文

迭代数据平滑:缓解RLHF中的奖励过拟合与过度优化

机器学习 2024-01-30 v1 人工智能 计算与语言 机器学习

摘要

基于人类反馈的强化学习(RLHF)是一项关键技术,它能使语言模型与以人为中心的价值观紧密对齐。RLHF的初始阶段涉及使用奖励模型从排序数据中学习人类价值观。据观察,奖励模型的性能在训练一个epoch后会下降,并且针对学习到的奖励模型进行过多优化最终会阻碍真实目标。本文深入探讨了这些问题,利用理论洞察设计了一种改进的奖励学习算法,称为“迭代数据平滑”(IDS)。其核心思想是,在每个训练epoch中,我们不仅用数据更新模型,还用模型更新数据,用软标签替换硬标签。我们的实证发现突显了这种方法相对于传统方法的优越性能。

关键词

引用

@article{arxiv.2401.16335,
  title  = {Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF},
  author = {Banghua Zhu and Michael I. Jordan and Jiantao Jiao},
  journal= {arXiv preprint arXiv:2401.16335},
  year   = {2024}
}