能量基偏好模型比Bradley-Terry偏好模型提供更好的离线对齐
机器学习
2024-12-19 v1 计算与语言
摘要
自DPO问世以来,已证明通过KL约束的RLHF损失将目标LLM与人类偏好对齐在数学上等价于一种特殊的奖励建模任务。具体来说,该任务要求:1)使用目标LLM参数化奖励模型,2)调整奖励模型使其与真实奖励具有1:1线性关系。然而,我们发现一个重要问题:DPO损失可能有多个极小值,其中只有一个满足所需的线性条件。该问题源于底层Bradley-Terry偏好模型的一个已知问题:它并不总是有唯一的最大似然估计(MLE)。因此,RLHF损失的极小值可能无法达到,因为它只是DPO损失众多极小值中的一个。作为更好的替代方案,我们提出了一种能量基模型(EBM),它总是有唯一的MLE,固有地满足线性要求。为了在实践中近似MLE,我们提出了一种对比损失,名为能量偏好对齐(EPA),其中每个正样本与一个或多个强负样本以及许多自由弱负样本进行对比。我们EBM的理论性质使得当使用足够多的负样本时,EPA的近似误差几乎必然消失。实验上,我们证明EPA在开放基准上始终优于DPO,从而展示了我们EBM的优越性。
引用
@article{arxiv.2412.13862,
title = {Energy-Based Preference Model Offers Better Offline Alignment than the Bradley-Terry Preference Model},
author = {Yuzhong Hong and Hanshan Zhang and Junwei Bao and Hongfei Jiang and Yang Song},
journal= {arXiv preprint arXiv:2412.13862},
year = {2024}
}