采样器在在线直接偏好优化中的关键作用
机器学习
2025-02-04 v3 计算与语言
摘要
直接偏好优化(Direct Preference Optimization, DPO)已成为一种稳定、可扩展且高效的语言模型对齐解决方案。尽管其在经验上取得了成功,但其优化特性,特别是采样器对其收敛速度的影响,仍未得到充分探索。在本文中,我们在精确梯度设定下,对不同采样策略下 DPO 的收敛速度进行了严格分析,揭示了一个令人惊讶的分离现象:均匀采样实现了线性收敛,而我们提出的在线采样器则实现了二次收敛。我们进一步通过结合后验分布和 logit 混合,将该采样器适配到实际设置中,证明了其相对于先前方法的改进。例如,在 Safe-RLHF 数据集上,它比普通 DPO 的性能高出超过 7.4%。我们的结果不仅为 DPO 的理论理解提供了见解,也为进一步的算法设计铺平了道路。
引用
@article{arxiv.2409.19605,
title = {The Crucial Role of Samplers in Online Direct Preference Optimization},
author = {Ruizhe Shi and Runlong Zhou and Simon S. Du},
journal= {arXiv preprint arXiv:2409.19605},
year = {2025}
}
备注
ICLR accepted