关于一般和随机博弈中马尔可夫完美均衡计算复杂性的研究
计算机科学与博弈论
2023-01-12 v2 计算复杂性
机器学习
多智能体系统
摘要
类似于马尔可夫决策过程在强化学习中的作用,随机博弈(SGs)为多智能体强化学习(MARL)和序列智能体交互的研究奠定了基础。在本文中,我们推导出在有限状态折扣随机博弈中计算指数精度下的近似马尔可夫完美均衡(MPE)是 \textbf{PPAD}-完全的。我们采用策略空间中具有多项式有界描述的函数,将 MPE 计算转化为不动点问题,尽管随机博弈可能要求每个智能体具有关于状态数量的指数级纯策略数。该完全性结果源于将不动点问题归约到 {\sc End of the Line}。我们的结果表明,在 SGs 中寻找 MPE 极不可能是 \textbf{NP}-难的,除非 \textbf{NP}=\textbf{co-NP}。我们的工作为 MARL 研究在一般和 SGs 上研究 MPE 计算并开发如当前在零和 SGs 上那样丰富的算法提供了信心。
引用
@article{arxiv.2109.01795,
title = {On the Complexity of Computing Markov Perfect Equilibrium in General-Sum Stochastic Games},
author = {Xiaotie Deng and Ningyuan Li and David Mguni and Jun Wang and Yaodong Yang},
journal= {arXiv preprint arXiv:2109.01795},
year = {2023}
}
备注
This paper has been fully published at National Science Review. Please refer to https://doi.org/10.1093/nsr/nwac256 for the official version