一类无限状态排队MDP的自然策略梯度收敛性
机器学习
2025-07-14 v3
摘要
各种各样的排队系统可以自然地建模为无限状态马尔可夫决策过程(MDP)。在强化学习(RL)背景下,已经开发出多种算法来学习和优化这些MDP。许多流行的基于策略梯度的学习算法,如自然演员-评论家、TRPO和PPO,其核心是自然策略梯度(NPG)策略优化算法。这些RL算法的收敛性结果依赖于NPG算法的收敛性结果。然而,所有关于NPG算法收敛性的现有结果都局限于有限状态设置。我们研究了一类通用的排队MDP,并证明了如果NPG算法以MaxWeight策略初始化,其收敛速度为。这是针对一类通用无穷状态平均奖励MDP的NPG算法的首个收敛速度界。此外,我们的结果适用于任何满足某些温和结构假设的可数无限MDP,前提是给定一个足够好的初始策略,这超越了排队设置。我们结果的关键在于NPG算法迭代策略所实现的相关值函数的状态依赖界限。
引用
@article{arxiv.2402.05274,
title = {Convergence of Natural Policy Gradient for a Family of Infinite-State Queueing MDPs},
author = {Isaac Grosof and Siva Theja Maguluri and R. Srikant},
journal= {arXiv preprint arXiv:2402.05274},
year = {2025}
}
备注
32 pages