中文

直接偏好优化的全面调查:数据集、理论、变体与应用

人工智能 2025-07-15 v3 计算与语言 机器学习

摘要

随着大型语言模型(LLM)的快速发展,与人类偏好相匹配的政策模型变得越来越关键。直接偏好优化(Direct Preference Optimization, DPO)已作为从人类反馈强化学习(Reinforcement Learning from Human Feedback, RLHF)中获得的无RL替代方案而引人注目。尽管DPO在各种方面取得了进展并存在固有的局限性,但目前文献中缺乏对这些方面的深入综述。在本工作中,我们提供了DPO挑战与机遇的全面综述,涵盖理论分析、变体、相关偏好数据集以及应用。具体而言,我们基于关键研究问题对近期DPO研究进行分类,以提供对DPO当前格局的 thorough 理解。此外,我们提出了几个未来研究方向,以为研究社区提供关于模型对齐的见解。相关论文的最新集合可在 https://github.com/Mr-Loevan/DPO-Survey 查找。

关键词

引用

@article{arxiv.2410.15595,
  title  = {A Comprehensive Survey of Direct Preference Optimization: Datasets, Theories, Variants, and Applications},
  author = {Wenyi Xiao and Zechuan Wang and Leilei Gan and Shuai Zhao and Zongrui Li and Ruirui Lei and Wanggui He and Luu Anh Tuan and Long Chen and Hao Jiang and Zhou Zhao and Fei Wu},
  journal= {arXiv preprint arXiv:2410.15595},
  year   = {2025}
}

备注

45 pages, 12 Figures. Project page: https://github.com/Mr-Loevan/DPO-Survey