中文

在线数据的重要性:通过覆盖理解偏好微调

机器学习 2024-07-17 v2 人工智能 计算与语言

摘要

从人类偏好数据中学习已成为微调大型语言模型(LLM)的主流范式。两类最常用的技术——在线强化学习(如近端策略优化PPO)和离线对比方法(如直接偏好优化DPO)——在先前工作中被认为等价,因为两者都必须从相同的离线偏好数据集开始。为了进一步从理论上理解在线与离线偏好微调技术的异同,我们通过数据集覆盖(一个捕捉训练数据如何覆盖测试分布并在强化学习中广泛使用的概念)的视角进行了严格分析。我们证明,全局覆盖条件对于离线对比方法收敛到最优策略既是必要的也是充分的,而较弱的局部覆盖条件就足以使在线强化学习方法收敛。这种分离为在线强化学习方法为何能比离线方法表现更好提供了一种解释,尤其是在离线偏好数据多样性不足时。最后,受前述理论观察的启发,我们推导出一种混合偏好优化(HyPO)算法,该算法使用离线数据进行基于对比的偏好优化,并使用在线数据进行KL正则化。理论和实验表明,HyPO比其纯离线对应方法DPO性能更优,同时保持了计算和内存效率。

关键词

引用

@article{arxiv.2406.01462,
  title  = {The Importance of Online Data: Understanding Preference Fine-tuning via Coverage},
  author = {Yuda Song and Gokul Swamy and Aarti Singh and J. Andrew Bagnell and Wen Sun},
  journal= {arXiv preprint arXiv:2406.01462},
  year   = {2024}
}