平均奖励马尔可夫决策过程中策略梯度的全局收敛性
机器学习
2024-03-12 v1 系统与控制
系统与控制
摘要
我们提出了无限时域平均奖励马尔可夫决策过程(MDPs)中策略梯度的首个有限时间全局收敛性分析。具体而言,我们关注具有有限状态空间和动作空间的遍历性表格型 MDPs。我们的分析表明,策略梯度迭代以 的次线性速率收敛至最优策略,这对应于 的遗憾(regret),其中 代表迭代次数。先前关于折扣奖励 MDPs 的性能界工作无法扩展至平均奖励 MDPs,因为这些界随有效时域的五次方成比例增长。因此,我们的主要贡献在于证明了策略梯度算法在平均奖励 MDPs 中的收敛性,并获得了有限时间性能保证。与现有的折扣奖励性能界相比,我们的性能界显式依赖于捕捉底层 MDP 复杂度的常数。受此观察启发,我们重新审视并改进了现有折扣奖励 MDPs 的性能界。我们还提供了仿真结果,以实证评估平均奖励策略梯度算法的性能。
引用
@article{arxiv.2403.06806,
title = {On the Global Convergence of Policy Gradient in Average Reward Markov Decision Processes},
author = {Navdeep Kumar and Yashaswini Murthy and Itai Shufaro and Kfir Y. Levy and R. Srikant and Shie Mannor},
journal= {arXiv preprint arXiv:2403.06806},
year = {2024}
}
备注
29 pages, 5 figures