迭代数据平滑:缓解RLHF中的奖励过拟合与过度优化
机器学习
2024-01-30 v1 人工智能
计算与语言
机器学习
摘要
基于人类反馈的强化学习(RLHF)是一项关键技术,它能使语言模型与以人为中心的价值观紧密对齐。RLHF的初始阶段涉及使用奖励模型从排序数据中学习人类价值观。据观察,奖励模型的性能在训练一个epoch后会下降,并且针对学习到的奖励模型进行过多优化最终会阻碍真实目标。本文深入探讨了这些问题,利用理论洞察设计了一种改进的奖励学习算法,称为“迭代数据平滑”(IDS)。其核心思想是,在每个训练epoch中,我们不仅用数据更新模型,还用模型更新数据,用软标签替换硬标签。我们的实证发现突显了这种方法相对于传统方法的优越性能。
引用
@article{arxiv.2401.16335,
title = {Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF},
author = {Banghua Zhu and Michael I. Jordan and Jiantao Jiao},
journal= {arXiv preprint arXiv:2401.16335},
year = {2024}
}