中文

分析与理解 DPO 的局限性:理论视角

计算与语言 2024-04-09 v1 人工智能

摘要

直接偏好优化(DPO)直接从成对偏好数据中导出奖励信号,在将大型语言模型(LLM)与人类偏好对齐方面已展现出其有效性。尽管 DPO 在各种任务中被广泛使用,但它因对 SFT 的有效性敏感以及阻碍对人类偏好响应的学习能力而受到批评,导致性能不尽如人意。为了克服这些局限性,对 DPO 的理论理解是必不可少的,但目前仍然缺乏。为此,我们在理论上分析并理解 DPO 的局限性迈出了一步。具体而言,我们提供了一个使用场论的分析框架来分析 DPO 的优化过程。通过分析 DPO 损失函数的梯度向量场,我们发现 DPO 损失函数降低生成人类不偏好数据的概率的速度快于其提高生成偏好数据概率的速度。这为理解相关研究实验中发现的 DPO 局限性提供了理论见解,从而为其改进奠定了基础。

关键词

引用

@article{arxiv.2404.04626,
  title  = {Towards Analyzing and Understanding the Limitations of DPO: A Theoretical Perspective},
  author = {Duanyu Feng and Bowen Qin and Chen Huang and Zheng Zhang and Wenqiang Lei},
  journal= {arXiv preprint arXiv:2404.04626},
  year   = {2024}
}

备注

Draft version