中文

PPO-Clip 的非渐近全局收敛性

最优化与控制 2025-12-19 v1 机器学习

摘要

强化学习(RL)因通过人类反馈的强化学习(RLHF)对齐大型语言模型(LLM)而受到关注。Proximal Policy Optimization(PPO)的仅演员变体因其效率而被广泛采用。这些算法采用裁剪机制以提高稳定性。此外,引入正则化项(如逆 KL 散度或更一般的 ff-散度)以防止策略漂移。尽管它们在经验上取得了成功,但对问题和算法属性的严格理论理解仍然有限。本文通过分析一般 RL 设置下采用 softmax 策略参数化的确定性仅演员 PPO 算法(带有 ff-散度正则化),推进了 PPO-Clip 算法的理论基础。我们推导了所考虑问题的非一致 Lipschitz 平滑条件和 Łojasiewicz 不等式。基于这些结果,针对前向 KL 正则化器建立了到全局最优策略的非渐近线性收敛速率。此外,针对逆 KL 正则化器推导了平稳收敛和局部线性收敛。

关键词

引用

@article{arxiv.2512.16565,
  title  = {Non-Asymptotic Global Convergence of PPO-Clip},
  author = {Yin Liu and Qiming Dai and Junyu Zhang and Zaiwen Wen},
  journal= {arXiv preprint arXiv:2512.16565},
  year   = {2025}
}