中文

基于离线偏好数据的在线 bandit 学习以提升 RLHF 效果

机器学习 2025-05-19 v4

摘要

强化学习人类反馈(RLHF)是生成式 AI 模型(语言和图像)微调方法的核心。这种反馈通常以排序或偏好形式由人类评估者提供,而非得分,因为后者往往较为噪声。在此基础上,RL 理论和算法主要假设可获得奖励反馈。特别是,无法 incorporat 离线偏好数据的在线学习方法在自适应数据收集(主动学习)中发挥着重要作用。本文采用有限臂线性 bandit 模型作为在线学习的原型模型。我们假设存在由未知‘能力’的专家生成的离线偏好数据集。我们提出了 warmPref-PS,即一种可使用带有噪声偏好反馈的离线数据集进行 warm start 的后验抽样算法。我们表明,通过建模生成该数据集的专家的‘能力’,可最大限度地有效地利用该数据集。我们通过对其贝叶斯后悔的新理论分析,以及对近似损失函数的广泛经验评估来支持我们的主张——该损失函数针对无限多个臂进行优化,且性能显著优于基线方法。

关键词

引用

@article{arxiv.2406.09574,
  title  = {Online Bandit Learning with Offline Preference Data for Improved RLHF},
  author = {Akhil Agnihotri and Rahul Jain and Deepak Ramachandran and Zheng Wen},
  journal= {arXiv preprint arXiv:2406.09574},
  year   = {2025}
}