中文

用于对齐的混合偏好优化:结合离线偏好与在线探索实现更快的收敛速率

机器学习 2024-12-17 v1

摘要

基于人类反馈的强化学习(RLHF)目前是将大型语言模型与人类偏好对齐的领先方法。通常,这些模型依赖大量离线偏好数据集进行训练。然而,离线算法施加了严格的集中性要求,这些要求往往难以满足。另一方面,虽然在线算法可以避免集中性问题,但纯在线探索可能因主动偏好查询成本和实时实现开销而昂贵。在本文中,我们提出了一种新方法:混合偏好优化(HPO),它通过放宽离线探索的严格集中性条件,将在线探索与现有离线偏好相结合,同时显著提高其在线对应物的样本效率。我们首次为混合RLHF提供了可证明最优的理论界限,为策略优化提供了与匹配下界相匹配的样本复杂度界限。我们的结果表明,混合RLHF相对于纯离线和纯在线探索具有改进的样本效率。

关键词

引用

@article{arxiv.2412.10616,
  title  = {Hybrid Preference Optimization for Alignment: Provably Faster Convergence Rates by Combining Offline Preferences with Online Exploration},
  author = {Avinandan Bose and Zhihan Xiong and Aadirupa Saha and Simon Shaolei Du and Maryam Fazel},
  journal= {arXiv preprint arXiv:2412.10616},
  year   = {2024}
}