中文

多智能体强化学习的一个重对数律

机器学习 2022-01-19 v3

摘要

在多智能体强化学习(MARL)中,多个智能体与一个公共环境交互,彼此之间也相互交互,以求解序贯决策中的共享问题。它在博弈、机器人、金融等领域有广泛应用。本工作中,我们推导了一族分布式非线性随机逼近方案的新颖重对数律,该结果对 MARL 有用。具体而言,我们的结果描述了在算法收敛的几乎每条样本路径上的收敛速率。该结果是分布式设定下的首例,并比现有仅讨论期望或 CLT 意义下收敛速率的结果提供了更深刻的见解。重要的是,我们的结果在显著更弱的假设下成立: gossip 矩阵无需是双随机的,步长也无需平方可和。作为一个应用,我们证明,对于步长 nγn^{-\gamma}(其中 γ(0,1)\gamma \in (0, 1)),带有线性函数逼近的分布式 TD(0) 算法几乎必然以 O(nγlnn)O(\sqrt{n^{-\gamma} \ln n }) 的速率收敛;对于 1/n1/n 型步长,同样的速率为几乎必然 O(n1lnlnn)O(\sqrt{n^{-1} \ln \ln n})。这些衰减速率不依赖于刻画不同智能体间交互的图。

关键词

引用

@article{arxiv.2110.15092,
  title  = {A Law of Iterated Logarithm for Multi-Agent Reinforcement Learning},
  author = {Gugan Thoppe and Bhumesh Kumar},
  journal= {arXiv preprint arXiv:2110.15092},
  year   = {2022}
}

备注

Some typos corrected; 19 pages