中文

基于奖励归因分解的多智能体协作

机器学习 2020-10-19 v1 人工智能 多智能体系统 机器学习

摘要

多智能体强化学习(MARL)的近期进展已在《雷神之锤3》和《Dota 2》等游戏中取得超越人类的表现。遗憾的是,这些技术所需的训练轮次比人类高数个数量级,且即便在同一游戏中也无法泛化到新的智能体配置。本文提出协作 Q 学习(CollaQ),其在星际争霸多智能体挑战中取得最先进性能,并支持临时组队博弈。我们首先将多智能体协作表述为奖励分配的联合优化,并表明每个智能体都有一个近似最优策略可分解为两部分:一部分仅依赖该智能体自身状态,另一部分与邻近智能体状态相关。遵循这一新发现,CollaQ 将每个智能体的 Q 函数分解为自身项与交互项,并以多智能体奖励归因(MARA)损失正则化训练。CollaQ 在各种星际争霸地图上进行评估,表明在相同样本数下,其胜率比现有最先进技术(即 QMIX、QTRAN 和 VDN)提高 40% 而表现更优。在更具挑战性的临时组队博弈设定(即不重新训练或微调而重新加权/增删单位)中,CollaQ 比此前 SoTA 高出 30% 以上。

关键词

引用

@article{arxiv.2010.08531,
  title  = {Multi-Agent Collaboration via Reward Attribution Decomposition},
  author = {Tianjun Zhang and Huazhe Xu and Xiaolong Wang and Yi Wu and Kurt Keutzer and Joseph E. Gonzalez and Yuandong Tian},
  journal= {arXiv preprint arXiv:2010.08531},
  year   = {2020}
}