中文

APO:Alpha 散度偏好优化

机器学习 2025-12-30 v1 人工智能

摘要

两种散度机制主导着现代对齐实践。监督微调和许多蒸馏式目标隐式地最小化前向 KL 散度 KL(q || pi_theta),产生稳定的覆盖模式更新,但往往未能充分利用高奖励模式。相比之下,基于人类反馈的 PPO 式在线强化学习行为更接近反向 KL 散度 KL(pi_theta || q),实现了寻模改进,但有模式坍塌的风险。最近的锚定方法(如 ADPO)表明,在锚定坐标中进行投影可以大幅提高稳定性,但它们通常固定于单一散度。我们引入了 Alpha 散度偏好优化(APO),这是一个使用 Csiszar alpha 散度在同一锚定几何中连续插值前向和反向 KL 行为的锚定框架。我们推导了由 alpha 参数化的统一梯度动力学,分析了梯度方差特性,并提出了一种实用的奖励与置信度保护的 alpha 调度,仅在策略既在改进又经过置信度校准时才从覆盖过渡到利用。在 Qwen3-1.7B 上使用 math-level3 的实验表明,APO 在保持训练稳定性的同时,实现了与 GRPO 和 GSPO 基线相当的性能。

关键词

引用

@article{arxiv.2512.22953,
  title  = {APO: Alpha-Divergence Preference Optimization},
  author = {Wang Zixian},
  journal= {arXiv preprint arXiv:2512.22953},
  year   = {2025}
}