中文

RODE:学习角色以分解多智能体任务

机器学习 2020-10-06 v1 机器学习

摘要

基于角色的学习有望通过利用角色分解复杂任务来实现可扩展的多智能体学习。然而,如何高效发现这样一组角色在很大程度上尚不清楚。为解决此问题,我们提出首先根据动作对环境及其他智能体的影响对动作进行聚类,将联合动作空间分解为受限的角色动作空间。基于动作效应学习角色选择器使得角色发现容易得多,因为它形成了一种双层学习层次——角色选择器在更小的角色空间和更低的时间分辨率下搜索,而角色策略在显著缩减的原语动作-观测空间中学习。我们进一步将关于动作效应的信息整合进角色策略中,以提升学习效率和策略泛化能力。凭借这些进展,我们的方法(1)在构成极具挑战性的 StarCraft II 微管理基准的 14 个场景中的 10 个上优于当前最先进的 MARL 算法,并且(2)实现了向智能体数量三倍于原环境的新环境的快速迁移。演示视频可在 https://sites.google.com/view/rode-marl 获取。

关键词

引用

@article{arxiv.2010.01523,
  title  = {RODE: Learning Roles to Decompose Multi-Agent Tasks},
  author = {Tonghan Wang and Tarun Gupta and Anuj Mahajan and Bei Peng and Shimon Whiteson and Chongjie Zhang},
  journal= {arXiv preprint arXiv:2010.01523},
  year   = {2020}
}