通过在线偏好优化实现大语言模型的人类对齐
机器学习
2024-03-14 v1 人工智能
机器学习
摘要
确保语言模型输出与人类偏好对齐,对于保障有用、安全和愉悦的用户体验至关重要。因此,人类对齐近期得到了广泛研究,并涌现出多种方法,如基于人类反馈的强化学习(RLHF)、直接策略优化(DPO)和序列似然校准(SLiC)。本文的贡献有两方面。首先,我们证明了两种近期对齐方法——身份策略优化(IPO)和纳什镜像下降(Nash-MD)——之间的等价性。其次,我们引入了IPO的一种推广形式,命名为IPO-MD,它利用了Nash-MD提出的正则化采样方法。这一等价性乍看可能令人惊讶,因为IPO是一种离线方法,而Nash-MD是一种使用偏好模型的在线方法。然而,当我们考虑IPO的在线版本,即两代样本均由在线策略采样并由训练好的偏好模型标注时,这一等价性便可得到证明。用这样的数据流优化IPO损失,便等价于通过自博弈寻找偏好模型的纳什均衡。基于这一等价性,我们引入了IPO-MD算法,该算法与一般的Nash-MD算法类似,使用混合策略(介于在线策略与参考策略之间)生成数据。我们在摘要任务上,将在线IPO和IPO-MD与基于偏好数据的现有损失函数(如DPO和SLiC)的不同在线版本进行了比较。
引用
@article{arxiv.2403.08635,
title = {Human Alignment of Large Language Models through Online Preference Optimisation},
author = {Daniele Calandriello and Daniel Guo and Remi Munos and Mark Rowland and Yunhao Tang and Bernardo Avila Pires and Pierre Harvey Richemond and Charline Le Lan and Michal Valko and Tianqi Liu and Rishabh Joshi and Zeyu Zheng and Bilal Piot},
journal= {arXiv preprint arXiv:2403.08635},
year = {2024}
}