异质智能体镜像学习:合作多智能体强化学习的连续解谱
多智能体系统
2022-08-04 v1 人工智能
摘要
智能机器间合作的需求使合作多智能体强化学习(MARL)在人工智能(AI)研究界中日益普及。然而,许多研究工作集中于开发实用的 MARL 算法,其有效性仅经实证考察,因而缺乏理论保证。正如近期研究所揭示的,MARL 方法常取得在奖励单调性上不稳定或收敛时次优的性能。为解决这些问题,本文引入一种名为异质智能体镜像学习(HAML)的新框架,为 MARL 算法设计提供通用模板。我们证明,由 HAML 模板导出的算法满足联合奖励单调改进与收敛至纳什均衡的所需性质。我们通过证明当前最先进的合作 MARL 算法 HATRPO 与 HAPPO 实为 HAML 实例,验证了 HAML 的实用性。接着,作为我们理论的自然结果,我们提出两种知名 RL 算法的 HAML 扩展,即 HAA2C(对应 A2C)与 HADDPG(对应 DDPG),并在 StarCraftII 与 Multi-Agent MuJoCo 任务上展示其相对于强基线的有效性。
引用
@article{arxiv.2208.01682,
title = {Heterogeneous-Agent Mirror Learning: A Continuum of Solutions to Cooperative MARL},
author = {Jakub Grudzien Kuba and Xidong Feng and Shiyao Ding and Hao Dong and Jun Wang and Yaodong Yang},
journal= {arXiv preprint arXiv:2208.01682},
year = {2022}
}