同伦策略镜像下降:策略收敛、隐式正则化与改进的样本复杂度
机器学习
2022-11-30 v9 人工智能
最优化与控制
摘要
我们提出一种新的策略梯度方法,称为同伦策略镜像下降(HPMD),用于求解具有有限状态和动作空间的折扣无限 horizon MDP。HPMD执行一种镜像下降类型的策略更新,并带有额外的递减正则化项,具备若干在文献中似乎新颖的计算性质。我们首先建立了以Kullback-Leibler散度实例化的HPMD在最优性间隙和到最优策略集的加权距离两方面的全局线性收敛性。然后在无任何假设下获得两方面的局部超线性收敛。借助局部加速和递减正则化,我们通过非渐近刻画表明末次迭代策略收敛到具有最大熵的唯一最优策略,从而建立了策略梯度方法中首个关于认证和刻画极限策略的结果。我们将上述所有结果推广到以广泛一类可分解Bregman散度实例化的HPMD,展示了这些计算性质的通用性。作为副产品,我们发现了某些常用Bregman散度的有限时间精确收敛,意味着即使当前策略已最优,HPMD仍持续收敛至极限策略。最后,我们发展了HPMD的随机版本并建立了类似的收敛性质。通过利用局部加速,我们表明在小的最优性间隙下,当假设用于策略评估的生成模型时,以高概率成立优于的样本复杂度。
引用
@article{arxiv.2201.09457,
title = {Homotopic Policy Mirror Descent: Policy Convergence, Implicit Regularization, and Improved Sample Complexity},
author = {Yan Li and Guanghui Lan and Tuo Zhao},
journal= {arXiv preprint arXiv:2201.09457},
year = {2022}
}