多步骤对齐作为马尔可夫博弈:基于乐观在线梯度下降的方法及收敛性保证
机器学习
2025-05-27 v2 人工智能
计算与语言
摘要
从人类反馈中进行强化学习(RLHF)在与人类偏好相匹配的大型语言模型方面取得了显著成功。虽然诸如DPO等流行方法表现出色,但它们将语言模型的交互建模为赌博问题,这限制了其在常见多轮对话场景中的适用性。此外,DPO依赖巴斯顿-蒂尔模型假设,无法充分捕捉人类偏好非传递性。本文通过将对齐问题建模为两人常和有限马尔可夫博弈来解决上述挑战,其中每位玩家试图在对话的每个步骤中最大化其对抗对手的胜率。我们提出的乐观多步骤偏好优化(Optimistic Multi-step Preference Optimization, OMPO)基于乐观在线镜像梯度下降算法。理论上,我们对OMPO的收敛进行了严格分析,表明OMPO需进行次策略更新即可收敛到近似纳什均衡。我们还在多轮对话数据集和数学推理数据集上验证了方法的有效性。
引用
@article{arxiv.2502.12678,
title = {Multi-Step Alignment as Markov Games: An Optimistic Online Gradient Descent Approach with Convergence Guarantees},
author = {Yongtao Wu and Luca Viano and Yihang Chen and Zhenyu Zhu and Kimon Antonakopoulos and Quanquan Gu and Volkan Cevher},
journal= {arXiv preprint arXiv:2502.12678},
year = {2025}
}