中文

QTRAN++:面向合作型多智能体强化学习的改进值变换

机器学习 2020-10-07 v2 机器学习

摘要

QTRAN 是一种多智能体强化学习(MARL)算法,能够学习迄今为止最大类别的联合动作值函数。然而,尽管其具有强大的理论保证,在复杂环境(如 Starcraft Multi-Agent Challenge (SMAC))中的实际经验性能却表现不佳。在本文中,我们找出了 QTRAN 的性能瓶颈,并提出了一种大幅改进的版本,命名为 QTRAN++。我们的性能提升来源于:(i) 稳定 QTRAN 的训练目标;(ii) 移除 QTRAN 动作值估计器之间严格的职责分离;以及 (iii) 引入多头混合网络进行值变换。通过广泛的评估,我们证实了诊断的正确性,并且 QTRAN++ 成功弥合了经验性能与理论保证之间的差距。特别地,QTRAN++ 在 SMAC 环境中取得了新的 state-of-the-art 性能。代码将开源发布。

关键词

引用

@article{arxiv.2006.12010,
  title  = {QTRAN++: Improved Value Transformation for Cooperative Multi-Agent Reinforcement Learning},
  author = {Kyunghwan Son and Sungsoo Ahn and Roben Delos Reyes and Jinwoo Shin and Yung Yi},
  journal= {arXiv preprint arXiv:2006.12010},
  year   = {2020}
}