Uni-DPO:大语言模型动态偏好优化的统一范式
机器学习
2026-05-26 v4 人工智能
计算与语言
计算机视觉与模式识别
摘要
直接偏好优化(Direct Preference Optimization, DPO)因其简洁性和高效性,已成为基于人类反馈的强化学习(RLHF)的基石。然而,现有的基于 DPO 的方法通常将所有偏好对同等对待,忽略了数据质量和学习难度的显著差异,从而导致数据利用效率低下和性能不佳。为解决这一局限,我们提出了 Uni-DPO,一个统一的动态偏好优化框架,联合考虑(a)偏好对的固有质量和(b)模型在训练过程中的演化表现。通过基于这两个因素自适应地重加权样本,Uni-DPO 实现了对偏好数据更有效的利用,并取得了更优的性能。在文本任务上,采用 Uni-DPO 微调的 Gemma-2-9B-IT 在 Arena-Hard 上超越了领先大语言模型 Claude 3 Opus 6.7 分。在数学和多模态任务上,Uni-DPO 在所有基准测试中一致优于基线方法,为其有效性和鲁棒性提供了强有力的经验证据。
引用
@article{arxiv.2506.10054,
title = {Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs},
author = {Shangpin Peng and Weinong Wang and Zhuotao Tian and Senqiao Yang and Xing Wu and Haotian Xu and Chengquan Zhang and Takashi Isobe and Baotian Hu and Min Zhang},
journal= {arXiv preprint arXiv:2506.10054},
year = {2026}
}
备注
Accepted by ICLR 2026. Code & models: https://github.com/pspdada/Uni-DPO