中文

基于人类判断列表排序的置换偏好对齐

计算与语言 2025-10-24 v2

摘要

与人类偏好保持一致是确保大型语言模型(LLM)具有可取且可控行为的关键。当前方法,如强化学习人类反馈(RLHF)和直接偏好优化(DPO),依赖Bradley-Terry(B-T)模型以最大化配对选择的似然性。然而,当多个响应可用时,B-T模型无法保证对响应的准确列表排序。为此,我们提出置换偏好对齐(Permutative Preference Alignment,PPA),一种新的离线列表级方法,将广泛使用的排序指标——归一化折扣累积收益(NDCG)纳入训练目标,作为替代方案。我们通过用可微分的替代损失近似NDCG,构建了端到端的对齐算法。实验表明,PPA在评估集和通用基准(如AlpacaEval)上超越了现有的配对级和列表级方法。此外,我们表明NDCG-based方法在排序准确性上的提升优于B-T-based方法,并提供了该改进的理论解释。

关键词

引用

@article{arxiv.2410.04346,
  title  = {Permutative Preference Alignment from Listwise Ranking of Human Judgments},
  author = {Yang Zhao and Yixin Wang and Mingzhang Yin},
  journal= {arXiv preprint arXiv:2410.04346},
  year   = {2025}
}

备注

Published at EMNLP 2025 Main Conference