自然策略梯度方法的几何与收敛性
最优化与控制
2024-02-21 v1 机器学习
系统与控制
系统与控制
摘要
我们研究无限 horizon 折扣马尔可夫决策过程中若干自然策略梯度(NPG)方法在正则策略参数化下的收敛性。针对多种NPG与奖励函数,我们证明状态-动作空间中的轨迹是相对于Hessian几何的梯度流的求解,并据此获得全局收敛保证与收敛速率。特别地,我们通过观察到Kakade与Morimura及其合作者提出的度量分别源于条件熵与熵的Hessian几何,展示了无正则与正则NPG流在这些度量下的线性收敛。进一步,我们获得源于对数障碍等其他凸函数的Hessian几何的次线性收敛速率。最后,若NPG相对于正则器的Hessian几何定义,我们将带正则奖励的离散时间NPG方法解释为不精确牛顿法。这给出了这些方法在步长等于惩罚强度时的局部二次收敛速率。
引用
@article{arxiv.2211.02105,
title = {Geometry and convergence of natural policy gradient methods},
author = {Johannes Müller and Guido Montúfar},
journal= {arXiv preprint arXiv:2211.02105},
year = {2024}
}
备注
33 pages, 5 figures, under review