中文

熵正则化强化学习中 Wasserstein 策略梯度的全局收敛

机器学习 2026-05-27 v2

摘要

Wasserstein 策略梯度(WPG)是一种针对强化学习(RL)的策略优化方法,利用动作分布的最优传输几何结构。对于熵正则化 RL 目标,WPG 通过沿软 Q 函数的动作梯度传递,并伴随 Langevin 类型扩散来演化每个状态条件下的策略。尽管其在连续控制问题中具有吸引力,但其全局收敛性仍不为人所理解。标准的 Langevin 分析无法直接适用,因为 RL 目标是通过贝尔曼递归而非静态凸函数来依赖于策略,同时 Langevin 扩散项由软 Q 函数决定,其规律性必须在策略迭代过程中得到控制。本文通过利用熵正则化 RL 的贝尔曼结构,发展出WPG的全局收敛理论。我们表明,通常由凸性承担的作用可以被贝尔曼方法所取代:软贝尔曼残差可相对于以 Gibbs 策略为基准的 KL 表达;贝尔曼收缩将该残差与全局最优间隙相联系;贝尔曼类比恒等式将价值改进与相对 Fisher 信息相联系。结合不断演化的 Gibbs 族所具有的均匀对数 Sobolev 不等式(LSI),这些构件共同导致了分布式的 Polyak--\L{}ojasiewicz 条件。我们进一步建立了控制离散化误差所需的规律性和均匀界限,从而获得至多离散化偏差的几何收敛。概念上,我们的分析表明,尽管熵正则化 RL 在常规平坦意义上非凸,但贝尔曼递归诱导出有利于WPG全局收敛的Polyak--Lojasiewicz 类型(PL)几何。

关键词

引用

@article{arxiv.2605.26078,
  title  = {Global Convergence of Wasserstein Policy Gradient for Entropy-Regularized Reinforcement Learning},
  author = {Zhaoyu Zhu and Rui Gao and Shuang Li},
  journal= {arXiv preprint arXiv:2605.26078},
  year   = {2026}
}