MA-Dreamer:通过共享想象进行协调与通信
机器学习
2022-04-12 v1 多智能体系统
摘要
多智能体强化学习(RL)由于个体智能体所感知环境的不平稳性而十分困难。使用 REINFORCE 估计器的理论严谨方法受其高方差的阻碍,而基于价值函数的方法则受到其对智能体间通信等情况的临时处理所引发问题的困扰。诸如 MADDPG 等方法进一步因其对集中式评论家等的要求而受限。为解决这些问题,我们提出 MA-Dreamer,一种基于模型的方法,它利用以智能体为中心和全局的可微环境模型,通过模型展开(即“想象”)来训练去中心化智能体的策略和评论家。由于仅有模型训练是离线的,智能体间通信/协调与“语言涌现”可以以直接的方式处理。我们在两个基于足球的博弈上将 MA-Dreamer 与其他方法的性能进行比较。实验表明,在长期说话者-听者任务和具有强部分可观测性的合作博弈中,MA-Dreamer 找到了有效利用协调的解决方案,而竞争方法分别仅获得边缘分数并彻底失败。通过在更宽松和通用的条件下有效实现协调与通信,我们的方法为研究更复杂的问题和基于种群的训练打开了大门。
引用
@article{arxiv.2204.04687,
title = {MA-Dreamer: Coordination and communication through shared imagination},
author = {Kenzo Lobos-Tsunekawa and Akshay Srinivasan and Michael Spranger},
journal= {arXiv preprint arXiv:2204.04687},
year = {2022}
}