中文

平均奖励马尔可夫势博弈中可证明的策略梯度方法

机器学习 2024-03-12 v1 计算机科学与博弈论

摘要

我们在无限时域平均奖励准则下研究马尔可夫势博弈 (Markov potential games)。大多数先前的研究针对的是折扣奖励。我们证明了基于独立策略梯度 (independent policy gradient) 和独立自然策略梯度 (independent natural policy gradient) 的两种算法均全局收敛于平均奖励准则下的纳什均衡。为基于梯度的方法奠定基础,我们首先在底层马尔可夫决策过程 (MDP) 满足某些遍历性和第二大特征值条件的情况下,确立了平均奖励是策略的光滑函数,并为微分值函数提供了敏感性界限。我们证明了三种算法——策略梯度、近端 Q (proximal-Q) 和自然策略梯度 (NPG)——在给定梯度/微分 Q 函数预言机的情况下,以 O(1ϵ2)O(\frac{1}{\epsilon^2}) 的时间复杂度收敛到 ϵ\epsilon-纳什均衡。当必须估计策略梯度时,我们提出了一种算法,其样本复杂度为 O~(1mins,aπ(as)δ)\tilde{O}(\frac{1}{\min_{s,a}\pi(a|s)\delta}),以实现相对于 2\ell_2 范数的 δ\delta 近似误差。配备该估计器后,我们推导出了策略梯度上升算法的首个样本复杂度分析,其样本复杂度为 O~(1/ϵ5)\tilde{O}(1/\epsilon^5)。文中展示了模拟研究结果。

关键词

引用

@article{arxiv.2403.05738,
  title  = {Provable Policy Gradient Methods for Average-Reward Markov Potential Games},
  author = {Min Cheng and Ruida Zhou and P. R. Kumar and Chao Tian},
  journal= {arXiv preprint arXiv:2403.05738},
  year   = {2024}
}

备注

38 pages, 7 figures, published to AISTAT-24