有状态主动协调器:协作多智能体强化学习中的协调与环境异质性
人工智能
2023-10-10 v3 机器学习
摘要
在协作多智能体强化学习中,一组智能体协同工作以达成共同目标。不同的环境或任务可能需要智能体间不同程度的协调,从而以最优方式实现目标。协调的性质取决于环境的属性——其空间布局、障碍分布、动力学等。我们将环境内此类属性的变化称为异质性。现有文献尚未充分关注不同环境可能具有不同异质性水平这一事实。我们形式化了环境的协调水平与异质性水平的概念,并提出了 HECOGrid——一套多智能体强化学习环境,通过对环境的协调与异质性水平提供定量控制,促进对不同 MARL 方法在不同协调与环境异质性水平下的实证评估。进一步,我们提出一种集中训练分散执行的学习方法,称为有状态主动协调器(SAF),其通过训练期间使用的可微分共享知识源以及从共享策略池中的动态选择,使智能体能在高协调与高异质性环境中高效工作。我们在 HECOGrid 上评估 SAF,并将其性能与基线 IPPO 和 MAPPO 进行比较。结果表明,SAF 在不同任务及不同异质性与协调水平下始终优于基线。我们发布了 HECOGrid 及所有实验的代码。
引用
@article{arxiv.2210.03022,
title = {Stateful active facilitator: Coordination and Environmental Heterogeneity in Cooperative Multi-Agent Reinforcement Learning},
author = {Dianbo Liu and Vedant Shah and Oussama Boussif and Cristian Meo and Anirudh Goyal and Tianmin Shu and Michael Mozer and Nicolas Heess and Yoshua Bengio},
journal= {arXiv preprint arXiv:2210.03022},
year = {2023}
}
备注
Published at ICLR 2023