中文

采样器在在线直接偏好优化中的关键作用

机器学习 2025-02-04 v3 计算与语言

摘要

直接偏好优化(Direct Preference Optimization, DPO)已成为一种稳定、可扩展且高效的语言模型对齐解决方案。尽管其在经验上取得了成功,但其优化特性,特别是采样器对其收敛速度的影响,仍未得到充分探索。在本文中,我们在精确梯度设定下,对不同采样策略下 DPO 的收敛速度进行了严格分析,揭示了一个令人惊讶的分离现象:均匀采样实现了线性收敛,而我们提出的在线采样器则实现了二次收敛。我们进一步通过结合后验分布和 logit 混合,将该采样器适配到实际设置中,证明了其相对于先前方法的改进。例如,在 Safe-RLHF 数据集上,它比普通 DPO 的性能高出超过 7.4%。我们的结果不仅为 DPO 的理论理解提供了见解,也为进一步的算法设计铺平了道路。

关键词

引用

@article{arxiv.2409.19605,
  title  = {The Crucial Role of Samplers in Online Direct Preference Optimization},
  author = {Ruizhe Shi and Runlong Zhou and Simon S. Du},
  journal= {arXiv preprint arXiv:2409.19605},
  year   = {2025}
}

备注

ICLR accepted