中文

关于改进去中心化多智能体强化学习的无模型算法

机器学习 2022-02-01 v2 人工智能 多智能体系统

摘要

多智能体强化学习(MARL)算法常受样本复杂度随智能体数量呈指数依赖的困扰,此现象被称为“多智能体诅咒”(the curse of multiagents)。本文通过研究“去中心化”MARL 中样本高效的无模型算法来应对该挑战,并旨在改进此类现有算法。针对一般和马尔可夫博弈中(粗)相关均衡的学习,我们提出基于阶段的 V-learning 算法,显著简化了近期工作的算法设计与分析,并规避了相当复杂的无加权后悔 bandit 子程序。针对马尔可夫势博弈中纳什均衡的学习,我们提出一种带有去中心化基于动量的方差缩减技术的独立策略梯度算法。我们所有算法均是去中心化的,即每个智能体仅可基于其本地信息做决策。学习期间无需通信或集中协调,从而可自然推广至大量智能体。我们还提供了数值模拟以佐证理论发现。

关键词

引用

@article{arxiv.2110.05707,
  title  = {On Improving Model-Free Algorithms for Decentralized Multi-Agent Reinforcement Learning},
  author = {Weichao Mao and Lin F. Yang and Kaiqing Zhang and Tamer Başar},
  journal= {arXiv preprint arXiv:2110.05707},
  year   = {2022}
}