中文

在星际争霸多智能体挑战中,独立学习就是你所需的一切吗?

人工智能 2020-11-20 v1

摘要

最近大多数在“集中训练、分散执行”设定下开发的协作多智能体强化学习方法都涉及估计一个集中的联合价值函数。在本文中,我们证明,尽管存在各种理论缺陷,Independent PPO(IPPO)——一种每个智能体仅简单估计其局部价值函数的独立学习形式——在流行的多智能体基准套件 SMAC 上,只需很少的超参数调优,就能表现得与最先进的联合学习方法一样好甚至更好。我们还将 IPPO 与若干变体进行比较;结果表明,IPPO 的强劲表现可能源于其对某些形式的环境非平稳性的鲁棒性。

关键词

引用

@article{arxiv.2011.09533,
  title  = {Is Independent Learning All You Need in the StarCraft Multi-Agent Challenge?},
  author = {Christian Schroeder de Witt and Tarun Gupta and Denys Makoviichuk and Viktor Makoviychuk and Philip H. S. Torr and Mingfei Sun and Shimon Whiteson},
  journal= {arXiv preprint arXiv:2011.09533},
  year   = {2020}
}