中文

RLHF 中奖励建模的最优设计

机器学习 2024-10-24 v2 机器学习

摘要

从人类反馈中强化学习(RLHF)已成为一种流行的方法来与人类偏好一致语言模型(LMs)。该方法涉及收集跨各种文本生成的人类两两偏好数据集,并用于推断(隐式或显式)奖励模型。已提出许多方法来学习奖励模型并与之一致 LMs。然而,收集人类偏好成本高的过程受到了很少的关注,可能从理论见解中受益。本文关注此问题,旨在形式化 RLHF 中的奖励训练模型。我们将有效数据集的选择框定为一个简单的 regret 最小化任务,使用线性情境对抗 bandit 方法。鉴于可能的臂数较大,这种方法比最佳臂识别设置更一致。我们然后提出了一个用于解决此问题的离线框架。在适当的假设下——奖励模型在嵌入空间中的线性性以及奖励参数的有界性——我们推导出简单的 regret 的下界。最后,我们提供一个下界,该下界在常数和对数项上与我们的上界相匹配。鉴于我们所知,这是该领域第一个提供离线方法以及最坏情况保证的理论贡献。

关键词

引用

@article{arxiv.2410.17055,
  title  = {Optimal Design for Reward Modeling in RLHF},
  author = {Antoine Scheid and Etienne Boursier and Alain Durmus and Michael I. Jordan and Pierre Ménard and Eric Moulines and Michal Valko},
  journal= {arXiv preprint arXiv:2410.17055},
  year   = {2024}
}