通过 f-散度最小化将语言模型与偏好对齐
计算与语言
2023-06-07 v2 机器学习
机器学习
摘要
将语言模型与偏好对齐可被表述为逼近代表某种期望行为的目标分布。现有方法在目标分布的函数形式以及用于逼近它的算法上均有所不同。例如,基于人类反馈的强化学习(RLHF)对应于最小化源于目标中 KL 惩罚的隐式目标分布的反向 KL。另一方面,生成式分布控制(GDC)具有显式目标分布,并使用分布策略梯度(DPG)算法最小化其前向 KL。在本文中,我们提出一种新方法 f-DPG,它允许使用任意 f-散度来逼近任何可求值的目标分布。f-DPG 统一了两种框架(RLHF、GDC)与逼近方法(DPG、带 KL 惩罚的 RL)。我们展示了各种散度目标选择的实用益处,并证明不存在普遍最优的目标,而是不同的散度呈现出不同的对齐与多样性权衡。我们展示 Jensen-Shannon 散度在这些目标间取得了良好平衡,且经常以较大优势优于前向 KL 散度,带来相对于先前工作的显著改进。这些散度之间的区分性特征随着模型规模增大而持续存在,凸显了选择适当散度目标的重要性。
引用
@article{arxiv.2302.08215,
title = {Aligning Language Models with Preferences through f-divergence Minimization},
author = {Dongyoung Go and Tomasz Korbak and Germán Kruszewski and Jos Rozen and Nahyeon Ryu and Marc Dymetman},
journal= {arXiv preprint arXiv:2302.08215},
year = {2023}
}