网络马尔可夫势博弈中局部化 actor-critic 的收敛速率
机器学习
2023-07-11 v2 人工智能
多智能体系统
摘要
我们引入一类网络马尔可夫势博弈,其中智能体与网络中的节点相关联。每个智能体拥有其局部势函数,且每个智能体的奖励仅依赖于邻域内智能体的状态与动作。在此背景下,我们提出一种局部化 actor-critic 算法。该算法可扩展,因为每个智能体仅使用局部信息且无需访问全局状态。此外,算法通过函数逼近克服了维数灾难。我们的主要结果给出了直至局部化误差与函数逼近误差的有限样本保证。具体而言,我们以平均 Nash 遗憾衡量的样本复杂度为 。这是首个不依赖于智能体数量的多智能体竞争博弈有限样本界。
引用
@article{arxiv.2303.04865,
title = {Convergence Rates for Localized Actor-Critic in Networked Markov Potential Games},
author = {Zhaoyi Zhou and Zaiwei Chen and Yiheng Lin and Adam Wierman},
journal= {arXiv preprint arXiv:2303.04865},
year = {2023}
}