平均奖励马尔可夫势博弈中可证明的策略梯度方法
机器学习
2024-03-12 v1 计算机科学与博弈论
摘要
我们在无限时域平均奖励准则下研究马尔可夫势博弈 (Markov potential games)。大多数先前的研究针对的是折扣奖励。我们证明了基于独立策略梯度 (independent policy gradient) 和独立自然策略梯度 (independent natural policy gradient) 的两种算法均全局收敛于平均奖励准则下的纳什均衡。为基于梯度的方法奠定基础,我们首先在底层马尔可夫决策过程 (MDP) 满足某些遍历性和第二大特征值条件的情况下,确立了平均奖励是策略的光滑函数,并为微分值函数提供了敏感性界限。我们证明了三种算法——策略梯度、近端 Q (proximal-Q) 和自然策略梯度 (NPG)——在给定梯度/微分 Q 函数预言机的情况下,以 的时间复杂度收敛到 -纳什均衡。当必须估计策略梯度时,我们提出了一种算法,其样本复杂度为 ,以实现相对于 范数的 近似误差。配备该估计器后,我们推导出了策略梯度上升算法的首个样本复杂度分析,其样本复杂度为 。文中展示了模拟研究结果。
引用
@article{arxiv.2403.05738,
title = {Provable Policy Gradient Methods for Average-Reward Markov Potential Games},
author = {Min Cheng and Ruida Zhou and P. R. Kumar and Chao Tian},
journal= {arXiv preprint arXiv:2403.05738},
year = {2024}
}
备注
38 pages, 7 figures, published to AISTAT-24