中文

超越表格 MDP 的熵正则化 Softmax 策略梯度的全局线性收敛性

机器学习 2026-05-26 v1 最优化与控制

摘要

我们研究了针对具有连续状态和动作空间的无限时程熵正则化马尔可夫决策过程(MDP)的策略梯度全局收敛性。我们考虑具有线性函数逼近的 log-linear Softmax 策略,这种策略扩展了表格 Softmax 参数化,同时保持可计算的策略类别。在 QτπQ^\pi_\tau-realizability 条件下,我们首先建立了非均匀的 Polyak--{\L}ojasiewicz(P\L)不等式。这种非均匀性源于与策略几何相关的常数的退化,即 Fisher 信息矩阵或未中心化特征协方差矩阵。随后,我们识别了两种特征情形,使得该非均匀常数在梯度流沿线可以被界定。在完全 affine 跨度特征情形下,我们证明了 KL 正则化器的径向无界性,并显示 Fisher 信息矩阵最小特征值保持在初始化依赖的正常数以下。在单纯形值特征情形下,我们证明了在与全 1 向量正交的子空间中实现类似的径向无界性结果,并获得了未中心化协方差矩阵最小特征值的统一下界。这些结果意味着沿梯度流,正则化目标函数具有全局线性收敛性,即次优性以 O(eCt)\mathcal{O}(e^{-Ct}) 形式衰减,其中 C>0C>0。我们的分析将熵正则化 Softmax 策略梯度的全局收敛理论扩展到了阿格瓦尔等人(2020);班哈迪德和鲁斯索(2024);梅等人(2020)之外的表格设置。

关键词

引用

@article{arxiv.2605.24939,
  title  = {Global linear convergence of entropy-regularized softmax policy gradient beyond tabular MDPs},
  author = {Ziyue Chen and David Šiška and Lukasz Szpruch},
  journal= {arXiv preprint arXiv:2605.24939},
  year   = {2026}
}