MAESTRO: 面向多智能体强化学习的开放式环境设计
机器学习
2023-03-07 v1 多智能体系统
摘要
开放式学习方法能够自动生成难度递增的任务课程,是迈向通用强化学习智能体的有前景途径。现有方法独立地适应环境参数(在单智能体设置中)或对手策略(在多智能体设置中)上的课程。然而,对手策略的优缺点可能因环境特征而异。因此,在多智能体领域中制定课程时,考虑环境与对手之间的依赖关系至关重要。在本工作中,我们利用这一见解,将无监督环境设计(UED)扩展到多智能体环境。随后,我们引入了面向开放式学习的多智能体环境设计策略师(MAESTRO),这是首个针对两人零和设置的多智能体UED方法。MAESTRO能高效地在环境和对手上生成对抗性联合课程,并在纳什均衡处达到极小化极大遗憾保证。实验表明,在离散和连续控制设置的竞争性两人游戏中,MAESTRO优于多个强基线方法。
引用
@article{arxiv.2303.03376,
title = {MAESTRO: Open-Ended Environment Design for Multi-Agent Reinforcement Learning},
author = {Mikayel Samvelyan and Akbir Khan and Michael Dennis and Minqi Jiang and Jack Parker-Holder and Jakob Foerster and Roberta Raileanu and Tim Rocktäschel},
journal= {arXiv preprint arXiv:2303.03376},
year = {2023}
}
备注
International Conference on Learning Representations (ICLR) 2023