解耦动力学马尔可夫博弈:无政府代价与样本复杂度
计算机科学与博弈论
2023-04-11 v1 最优化与控制
摘要
本文研究了有限时域马尔可夫博弈,其中智能体的动力学是解耦的,但奖励可能在智能体间存在耦合。策略类被限制为局部策略,即智能体利用其局部状态进行决策。我们首先引入了平滑马尔可夫博弈的概念,将范式博弈的平滑性论证推广到我们的设定中,并利用平滑性性质来界定该马尔可夫博弈的无政府代价。对于一类称为马尔可夫势博弈的特定马尔可夫博弈,我们还开发了一种分布式学习算法——多智能体软策略迭代(MA-SPI),该算法可证明收敛到纳什均衡。我们还给出了该算法的样本复杂度。最后,我们使用一个动态覆盖博弈验证了我们的结果。
引用
@article{arxiv.2304.03840,
title = {Markov Games with Decoupled Dynamics: Price of Anarchy and Sample Complexity},
author = {Runyu Zhang and Yuyang Zhang and Rohit Konda and Bryce Ferguson and Jason Marden and Na Li},
journal= {arXiv preprint arXiv:2304.03840},
year = {2023}
}