中文

重新审视DPO:拒绝响应在偏好错位中的作用

人工智能 2025-06-17 v1 计算与语言

摘要

直接偏好优化(DPO)是一种简单高效的框架,已引起广泛关注。然而,由于拒绝响应在损失函数中的主导影响,它往往难以实现其主要目标——增加选择响应的生成概率同时减少拒绝响应的生成概率。这种不平衡导致在促进偏好响应方面的次优性能。在本工作中,我们系统地分析了DPO的局限性以及现有旨在实现上述目标的算法。为解决这些局限性,我们提出有界DPO(BDPO),一种在保持DPO原始优化结构的同时限制拒绝响应影响的新方法。通过理论分析和实证评估,我们证明BDPO实现了选择响应和拒绝响应的平衡优化,优于现有算法。

关键词

引用

@article{arxiv.2506.12725,
  title  = {Rethinking DPO: The Role of Rejected Responses in Preference Misalignment},
  author = {Jay Hyeon Cho and JunHyeok Oh and Myunsoo Kim and Byung-Jun Lee},
  journal= {arXiv preprint arXiv:2506.12725},
  year   = {2025}
}