中文

用于 RLHF 的数据集重置策略优化

机器学习 2024-04-17 v3 人工智能 计算与语言

摘要

基于人类偏好反馈的强化学习(RL)是微调生成模型的一种流行范式,它产生了诸如 GPT-4 和 Claude3 Opus 等令人印象深刻的模型。该框架通常包含两个步骤:从离线偏好数据集中学习奖励模型,随后运行在线 RL 以优化学习到的奖励模型。在这项工作中,利用重置的思想,我们提出了一种具有可证明保证的新 RLHF 算法。鉴于离线偏好数据集提供了信息丰富的状态(即标注者偏好的数据),我们的新算法——数据集重置策略优化(DR-PO),通过数据集重置将现有的离线偏好数据集整合到在线策略训练过程中:它直接将策略优化器重置为离线数据集中的状态,而不是始终从初始状态分布开始。在理论上,我们证明了在具有有限样本复杂度的一般函数逼近下,DR-PO 的学习表现至少与离线数据集所覆盖的任何策略一样好。在实验中,我们证明了在 TL;DR 摘要和 Anthropic Helpful Harmful(HH)数据集上,在 GPT4 胜率的指标下,DR-PO 的生成结果优于近端策略优化(PPO)和直接偏好优化(DPO)的生成结果。本工作的代码可在 https://github.com/Cornell-RL/drpo 找到。

关键词

引用

@article{arxiv.2404.08495,
  title  = {Dataset Reset Policy Optimization for RLHF},
  author = {Jonathan D. Chang and Wenhao Zhan and Owen Oertell and Kianté Brantley and Dipendra Misra and Jason D. Lee and Wen Sun},
  journal= {arXiv preprint arXiv:2404.08495},
  year   = {2024}
}

备注

28 pages, 6 tables, 3 Figures, 3 Algorithms