中文

RLHF 中的策略优化:偏好外数据的影响

机器学习 2024-02-27 v2

摘要

将智能体与人类偏好和价值观对齐十分重要。本文考察了两种流行的对齐方法:直接偏好优化(DPO)和基于奖励模型的策略优化(RMB-PO)。同时考虑了 RMB-PO 的一个变体,称为 RMB-PO+。这些方法要么显式要么隐式地从偏好数据中学习奖励模型,其区别在于用于策略优化的数据不同,以解锁奖励模型的泛化能力。具体而言,与 DPO 相比,RMB-PO 额外使用了策略生成的数据,而 RMB-PO+ 进一步利用了新的无偏好数据。我们考察了此类偏好外数据的影响。我们通过受控和合成实验进行的研究表明,DPO 表现较差,而 RMB-PO+ 表现最好。特别是,即使为策略模型提供良好的特征表示,我们发现利用充足的偏好外数据进行策略优化,能够通过发挥奖励模型的泛化能力显著提升性能。

关键词

引用

@article{arxiv.2312.10584,
  title  = {Policy Optimization in RLHF: The Impact of Out-of-preference Data},
  author = {Ziniu Li and Tian Xu and Yang Yu},
  journal= {arXiv preprint arXiv:2312.10584},
  year   = {2024}
}