中文

基于对比散度的偏好优化:你的奖励模型暗地里是一个 NLL 估计器

人工智能 2025-02-10 v1

摘要

现有的偏好优化(PO)研究集中在遵循简单启发式方法构建成对偏好数据,例如根据人类(或 AI)排名分数最大化偏好与不偏好补全之间的间隔。然而,这些启发式方法都没有完整的理论证明。在本工作中,我们开发了一个新颖的 PO 框架,为有效采样不偏好补全提供理论指导。为了实现这一点,我们将 PO 表述为最小化概率模型的负对数似然(NLL),并提出通过采样策略来估计其归一化常数。正如我们将展示的,这些估计样本可以作为 PO 中的不偏好补全。然后,我们选择对比散度(CD)作为采样策略,并提出了一种新颖的 MC-PO 算法,该算法应用来自 CD 的蒙特卡洛(MC)核来采样相对于参数化奖励模型的困难负样本。最后,我们提出了 OnMC-PO 算法,这是 MC-PO 在在线设置下的扩展。在流行的对齐基准上,MC-PO 优于现有的 SOTA 基线,而 OnMC-PO 带来了进一步的提升。

关键词

引用

@article{arxiv.2502.04567,
  title  = {Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator},
  author = {Zhuotong Chen and Fang Liu and Xuan Zhu and Yanjun Qi and Mohammad Ghavamzadeh},
  journal= {arXiv preprint arXiv:2502.04567},
  year   = {2025}
}