打破大状态空间中多智能体的维度诅咒:基于独立线性函数逼近的马尔可夫博弈强化学习
机器学习
2023-06-23 v3 人工智能
计算机科学与博弈论
多智能体系统
机器学习
摘要
我们提出了一种新模型——独立线性马尔可夫博弈,用于具有大状态空间和多智能体的多智能体强化学习。这是一类具有独立线性函数逼近的马尔可夫博弈,其中每个智能体拥有自己的状态-动作值函数逼近,这些函数由其他参与者的策略边缘化。我们设计了用于学习马尔可夫粗相关均衡(CCE)和马尔可夫相关均衡(CE)的新算法,其样本复杂度上界仅随每个智能体自身函数类的复杂度多项式增长,从而打破了多智能体的维度诅咒。相比之下,现有的带函数逼近的马尔可夫博弈工作,在特化到典型的表格马尔可夫博弈设定时,样本复杂度上界随联合动作空间的大小而增长,而该空间在智能体数量上是指数级大的。我们的算法依赖于两项关键技术革新:(1)利用策略重放应对由多智能体和函数逼近使用引起的非平稳性;(2)将马尔可夫博弈中马尔可夫均衡的学习与探索分离,这使我们能够使用全信息无遗憾学习预言机,而非表格设定中使用的更强的赌博机反馈无遗憾学习预言机。此外,我们提出了一种迭代最佳响应型算法,可在独立线性马尔可夫势博弈中学习纯马尔可夫纳什均衡。在表格情形下,通过适配独立线性马尔可夫博弈的策略重放机制,我们提出了一种具有 样本复杂度来学习马尔可夫 CCE 的算法,该结果改进了 Daskalakis 等人 2022 年的最优结果 (其中 为期望精度),并且也显著改进了其他问题参数。
引用
@article{arxiv.2302.03673,
title = {Breaking the Curse of Multiagents in a Large State Space: RL in Markov Games with Independent Linear Function Approximation},
author = {Qiwen Cui and Kaiqing Zhang and Simon S. Du},
journal= {arXiv preprint arXiv:2302.03673},
year = {2023}
}
备注
51 pages. Update: Accepted for presentation at the Conference on Learning Theory (COLT) 2023