中文

马尔可夫博弈中独立学习的困难性与稀疏均衡计算

机器学习 2023-03-23 v1 人工智能 计算机科学与博弈论 机器学习

摘要

我们考虑马尔可夫博弈中的去中心化多智能体强化学习问题。一个基本问题是:是否存在这样的算法,当被所有智能体采用并以去中心化方式独立运行时,能为每个参与者带来无遗憾,类似于正态形式博弈中著名的收敛结果。虽然近期工作表明此类算法在受限设定下存在(值得注意的是,当遗憾是相对于偏离至马尔可夫策略来定义时),但在标准马尔可夫博弈框架下独立无遗憾学习是否可实现仍是开放问题。我们从计算和统计两个角度对该问题给出了决定性的否定回答。我们表明:- 在广泛相信的 PPAD 困难问题不能在多项式时间内求解的假设下,当所有玩家独立执行时,不存在能在一般和马尔可夫博弈中实现无遗憾的多项式时间算法,即使博弈对算法设计者已知且玩家数量为小常数。- 当博弈未知时,任何算法,无论计算效率如何,若不观测到数量对玩家数呈指数级的回合,都无法实现无遗憾。或许令人惊讶的是,我们的下界甚至对看似更简单的设定也成立,其中所有智能体由一个集中式算法控制。这些下界通过对一个我们称为 SparseCCE 的更简单问题的下界证明,该问题中目标是计算粗相关均衡,其稀疏性在于它可表示为少量乘积策略的混合。我们方法的关键在于对在线学习中聚合技术的创新应用,由此我们表明 SparseCCE 问题的任何算法都可用于计算非零和正态形式博弈的近似纳什均衡。

关键词

引用

@article{arxiv.2303.12287,
  title  = {Hardness of Independent Learning and Sparse Equilibrium Computation in Markov Games},
  author = {Dylan J. Foster and Noah Golowich and Sham M. Kakade},
  journal= {arXiv preprint arXiv:2303.12287},
  year   = {2023}
}

备注

51 pages