探索性偏好优化:利用隐式Q*逼近实现样本高效的RLHF
机器学习
2024-06-03 v1 人工智能
计算与语言
机器学习
摘要
基于人类反馈的强化学习(RLHF)已成为语言模型对齐的核心工具。我们考虑RLHF中的在线探索,通过故意鼓励模型生成多样化、信息量最大的响应,利用对人类或AI反馈的交互式访问。通过允许RLHF自信地偏离预训练模型,在线探索提供了获得新颖、可能超人类能力的可能性,但由于直接适配现有强化学习技术的计算和统计瓶颈,其作为语言模型训练范式的全部潜力尚未实现。我们提出了一种新的RLHF在线探索算法——探索性偏好优化(XPO),该算法简单实用——仅需对(在线)直接偏好优化(DPO;Rafailov等人,2023)进行一行修改——却享有已知最强的可证明保证和有希望的实证性能。XPO通过一个新颖且原则性的探索奖励增强DPO目标,使算法能够在初始模型和人类反馈数据的支持集之外进行探索。理论上,我们证明XPO在自然探索条件下是样本高效的,并且收敛到接近最优的语言模型策略,无论初始模型是否具有良好的覆盖。我们的分析基于DPO隐式执行一种逼近(或Bellman误差最小化)的观察,通过KL正则化马尔可夫决策过程的视角,将语言建模和理论强化学习中先前不同的技术巧妙地结合起来。实证上,我们在初步评估中发现XPO比非探索性DPO变体更具样本效率。
引用
@article{arxiv.2405.21046,
title = {Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF},
author = {Tengyang Xie and Dylan J. Foster and Akshay Krishnamurthy and Corby Rosset and Ahmed Awadallah and Alexander Rakhlin},
journal= {arXiv preprint arXiv:2405.21046},
year = {2024}
}