中文

平均奖励马尔可夫决策过程中策略梯度的全局收敛性

机器学习 2024-03-12 v1 系统与控制 系统与控制

摘要

我们提出了无限时域平均奖励马尔可夫决策过程(MDPs)中策略梯度的首个有限时间全局收敛性分析。具体而言,我们关注具有有限状态空间和动作空间的遍历性表格型 MDPs。我们的分析表明,策略梯度迭代以 O(1T)O\left({\frac{1}{T}}\right) 的次线性速率收敛至最优策略,这对应于 O(log(T))O\left({\log(T)}\right) 的遗憾(regret),其中 TT 代表迭代次数。先前关于折扣奖励 MDPs 的性能界工作无法扩展至平均奖励 MDPs,因为这些界随有效时域的五次方成比例增长。因此,我们的主要贡献在于证明了策略梯度算法在平均奖励 MDPs 中的收敛性,并获得了有限时间性能保证。与现有的折扣奖励性能界相比,我们的性能界显式依赖于捕捉底层 MDP 复杂度的常数。受此观察启发,我们重新审视并改进了现有折扣奖励 MDPs 的性能界。我们还提供了仿真结果,以实证评估平均奖励策略梯度算法的性能。

关键词

引用

@article{arxiv.2403.06806,
  title  = {On the Global Convergence of Policy Gradient in Average Reward Markov Decision Processes},
  author = {Navdeep Kumar and Yashaswini Murthy and Itai Shufaro and Kfir Y. Levy and R. Srikant and Shie Mannor},
  journal= {arXiv preprint arXiv:2403.06806},
  year   = {2024}
}

备注

29 pages, 5 figures