价值激励偏好优化:在线和离线RLHF的统一方法
机器学习
2025-02-20 v4 人工智能
机器学习
摘要
基于人类反馈的强化学习在使大型语言模型与人类偏好对齐方面展现出巨大潜力。根据偏好数据的可用性,在线和离线RLHF都是活跃的研究领域。一个关键瓶颈在于理解如何将不确定性估计纳入从偏好数据中学习的奖励函数中,无论偏好数据是如何收集的。尽管在标准强化学习中,不确定性下的乐观或悲观原则已得到充分确立,但适用于大型语言模型的实用且具有理论依据的形式尚未出现,因为在任意策略参数化下,构建置信区间的标准技术变得难以处理。在本文中,我们引入了在线和离线RLHF的统一方法——价值激励偏好优化,该方法用相应的价值函数对奖励函数的最大似然估计进行正则化,并通过一个符号来指示选择乐观还是悲观。VPO还通过隐式奖励建模直接优化策略,因此共享类似于直接偏好优化的更简单的RLHF流程。我们为在线和离线设置提供了VPO的理论保证,其速率与标准RL对应物相匹配。此外,在文本摘要和对话上的实验验证了VPO的实用性和有效性。
引用
@article{arxiv.2405.19320,
title = {Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF},
author = {Shicong Cen and Jincheng Mei and Katayoon Goshvadi and Hanjun Dai and Tong Yang and Sherry Yang and Dale Schuurmans and Yuejie Chi and Bo Dai},
journal= {arXiv preprint arXiv:2405.19320},
year = {2025}
}
备注
ICLR 2025