基于最优传输的LLM分布式偏好对齐
机器学习
2024-06-11 v1 机器学习
摘要
当前的LLM对齐技术使用成对的人类偏好,针对样本级别,因此并不意味着对齐分布层面的对齐。我们在本文中提出Alignment via Optimal Transport(AOT),一种用于LLM分布式偏好对齐的新方法。AOT通过使正样本的奖励分布在正样本分布上的一次阶 stochastic dominance来实现对齐。我们引入对一次阶 stochastic dominance的凸松弛,并将其作为具有光滑凸成本的最优传输问题。由于所得最优传输问题的一维性质以及成本的凸性,其通过经验测度的排序可获得闭式解。我们使用AOT目标对LLM进行微调,这使得通过惩罚正样本奖励分布对负样本奖励分布违反 stochastic dominance来实现对齐。我们通过考虑OT问题的对偶性并显示其在参数速率下收敛来分析AOT的样本复杂度。经验上,我们在多样化的对齐数据集和LLM上表明,AOT在Open LLM Benchmark和AlpacaEval评估下,在7B模型系列中实现了最先进的模型。
关键词
引用
@article{arxiv.2406.05882,
title = {Distributional Preference Alignment of LLMs via Optimal Transport},
author = {Igor Melnyk and Youssef Mroueh and Brian Belgodere and Mattia Rigotti and Apoorva Nitsure and Mikhail Yurochkin and Kristjan Greenewald and Jiri Navratil and Jerret Ross},
journal= {arXiv preprint arXiv:2406.05882},
year = {2024}
}