中文

打破大状态空间中多智能体的维度诅咒:基于独立线性函数逼近的马尔可夫博弈强化学习

机器学习 2023-06-23 v3 人工智能 计算机科学与博弈论 多智能体系统 机器学习

摘要

我们提出了一种新模型——独立线性马尔可夫博弈,用于具有大状态空间和多智能体的多智能体强化学习。这是一类具有独立线性函数逼近的马尔可夫博弈,其中每个智能体拥有自己的状态-动作值函数逼近,这些函数由其他参与者的策略边缘化。我们设计了用于学习马尔可夫粗相关均衡(CCE)和马尔可夫相关均衡(CE)的新算法,其样本复杂度上界仅随每个智能体自身函数类的复杂度多项式增长,从而打破了多智能体的维度诅咒。相比之下,现有的带函数逼近的马尔可夫博弈工作,在特化到典型的表格马尔可夫博弈设定时,样本复杂度上界随联合动作空间的大小而增长,而该空间在智能体数量上是指数级大的。我们的算法依赖于两项关键技术革新:(1)利用策略重放应对由多智能体和函数逼近使用引起的非平稳性;(2)将马尔可夫博弈中马尔可夫均衡的学习与探索分离,这使我们能够使用全信息无遗憾学习预言机,而非表格设定中使用的更强的赌博机反馈无遗憾学习预言机。此外,我们提出了一种迭代最佳响应型算法,可在独立线性马尔可夫势博弈中学习纯马尔可夫纳什均衡。在表格情形下,通过适配独立线性马尔可夫博弈的策略重放机制,我们提出了一种具有 O~(ϵ2)\widetilde{O}(\epsilon^{-2}) 样本复杂度来学习马尔可夫 CCE 的算法,该结果改进了 Daskalakis 等人 2022 年的最优结果 O~(ϵ3)\widetilde{O}(\epsilon^{-3})(其中 ϵ\epsilon 为期望精度),并且也显著改进了其他问题参数。

关键词

引用

@article{arxiv.2302.03673,
  title  = {Breaking the Curse of Multiagents in a Large State Space: RL in Markov Games with Independent Linear Function Approximation},
  author = {Qiwen Cui and Kaiqing Zhang and Simon S. Du},
  journal= {arXiv preprint arXiv:2302.03673},
  year   = {2023}
}

备注

51 pages. Update: Accepted for presentation at the Conference on Learning Theory (COLT) 2023