中文

在策略偏好学习的覆盖率提升与快速收敛

机器学习 2026-01-14 v1

摘要

用于语言模型对齐的在线在策略偏好学习算法(如在线直接策略优化)可以显著优于其离线对应方法。我们通过分析采样策略的覆盖率在在策略训练过程中的演化,为这一现象提供了理论解释。我们提出并严格论证了覆盖率提升原则:在足够的批量大小下,每次更新都会移动到目标附近覆盖率一致更好的区域,使得后续数据的信息量不断增加,从而实现快速收敛。在具有 Bradley-Terry 偏好和线性 softmax 策略类的上下文老虎机设定中,我们证明了对于超过广义覆盖率阈值的批量大小,在策略 DPO 随迭代次数呈指数收敛。相比之下,任何局限于初始策略离线样本的学习者都会遭受较慢的极小化极大收敛速率,导致总样本复杂度上的急剧分离。受此分析启发,我们进一步提出了一种基于新型偏好 G-最优设计的简单混合采样器,它消除了对覆盖率的依赖并保证在仅两轮内收敛。最后,我们在一般函数类设定下开发了用于奖励蒸馏的原则性在策略方案,并证明了在基于偏差的替代覆盖率概念下具有更快的无噪声收敛速率。在实验上,我们证实了在策略 DPO 和我们提出的奖励蒸馏算法优于其离策略对应方法,并在迭代中享有稳定、单调的性能提升。

关键词

引用

@article{arxiv.2601.08421,
  title  = {Coverage Improvement and Fast Convergence of On-policy Preference Learning},
  author = {Juno Kim and Jihun Yun and Jason D. Lee and Kwang-Sung Jun},
  journal= {arXiv preprint arXiv:2601.08421},
  year   = {2026}
}

备注

46 pages, 2 figures, 2 tables