多智能体强化学习的一个重对数律
机器学习
2022-01-19 v3
摘要
在多智能体强化学习(MARL)中,多个智能体与一个公共环境交互,彼此之间也相互交互,以求解序贯决策中的共享问题。它在博弈、机器人、金融等领域有广泛应用。本工作中,我们推导了一族分布式非线性随机逼近方案的新颖重对数律,该结果对 MARL 有用。具体而言,我们的结果描述了在算法收敛的几乎每条样本路径上的收敛速率。该结果是分布式设定下的首例,并比现有仅讨论期望或 CLT 意义下收敛速率的结果提供了更深刻的见解。重要的是,我们的结果在显著更弱的假设下成立: gossip 矩阵无需是双随机的,步长也无需平方可和。作为一个应用,我们证明,对于步长 (其中 ),带有线性函数逼近的分布式 TD(0) 算法几乎必然以 的速率收敛;对于 型步长,同样的速率为几乎必然 。这些衰减速率不依赖于刻画不同智能体间交互的图。
引用
@article{arxiv.2110.15092,
title = {A Law of Iterated Logarithm for Multi-Agent Reinforcement Learning},
author = {Gugan Thoppe and Bhumesh Kumar},
journal= {arXiv preprint arXiv:2110.15092},
year = {2022}
}
备注
Some typos corrected; 19 pages