中文

多智能体决策制定的复杂性:从博弈学习到部分监测

机器学习 2023-05-02 v1 人工智能 计算机科学与博弈论 多智能体系统 机器学习

摘要

多智能体强化学习(MARL)理论中的一个核心问题是理解何种结构条件与算法原理能带来样本高效的学习保证,以及当我们从少量智能体转向大量智能体时这些考量如何变化。我们在一个涵盖带函数逼近的马尔可夫博弈与带赌博机反馈的范式博弈的多智能体交互式决策通用框架中研究该问题。我们聚焦于均衡计算,其中 centralized 学习算法旨在通过控制多个与未知环境交互的智能体来计算均衡。我们的主要贡献是:- 我们基于决策-估计系数(Decision-Estimation Coefficient)的多智能体推广,给出了多智能体决策制定最优样本复杂度的上界与下界,该复杂度度量由Foster等人(2021)在其单智能体对应设定中引入。与单智能体设定下的最佳结果相比,我们的界存在额外鸿沟。我们证明任何“合理”的复杂度度量都无法弥合这些鸿沟,凸显了单智能体与多智能体之间的显著分离。- 我们证明刻画多智能体决策制定的统计复杂性等价于刻画单智能体决策制定的统计复杂性,但带有隐藏(未观测)奖励,这一框架包含了部分监测问题的变体。作为推论,我们在尽可能最佳程度上刻画了隐藏奖励交互式决策制定的统计复杂性。基于这一进展,我们提供了若干新的结构结果,包括 1) 多智能体决策制定的统计复杂性可约简为单智能体的条件,以及 2) 可避免所谓多智能体诅咒的条件。

关键词

引用

@article{arxiv.2305.00684,
  title  = {On the Complexity of Multi-Agent Decision Making: From Learning in Games to Partial Monitoring},
  author = {Dylan J. Foster and Dean P. Foster and Noah Golowich and Alexander Rakhlin},
  journal= {arXiv preprint arXiv:2305.00684},
  year   = {2023}
}

备注

95 pages