中文

离线预训练多智能体决策Transformer:一个大型序列模型攻克所有SMAC任务

机器学习 2022-06-13 v3 人工智能 多智能体系统

摘要

离线强化学习利用先前收集的离线数据集学习最优策略,无需访问真实环境。考虑到智能体之间及与环境的相互作用增强,此类范式在多智能体强化学习(MARL)任务中同样备受青睐。然而,在MARL中,离线预训练结合在线微调的范式尚未被研究,且尚无用于离线MARL研究的数据集或基准。本文通过提供大规模数据集来促进该研究,并用其考察Decision Transformer在MARL背景下的使用。我们从以下三方面探究MARL离线预训练的泛化性:1)单智能体与多智能体之间,2)从离线预训练到在线微调,3)面向具有少样本和零样本能力的多个下游任务。我们首先基于StarCraftII环境引入首个具有多样质量水平的离线MARL数据集,进而提出用于有效离线学习的多智能体决策Transformer(MADT)新架构。MADT利用Transformer的序列建模能力,并无缝集成于离线和在线MARL任务。MADT的一个关键优势在于其学习到的可泛化策略能在不同任务场景下不同智能体类型间迁移。在StarCraft II离线数据集上,MADT优于最先进的离线RL基线。应用于在线任务时,预训练MADT显著提升了样本效率,并在少样本和零样本情况下均具备强劲性能。据我们所知,这是首项研究并证明离线预训练模型在MARL中提升样本效率与泛化能力的有效性的工作。

关键词

引用

@article{arxiv.2112.02845,
  title  = {Offline Pre-trained Multi-Agent Decision Transformer: One Big Sequence Model Tackles All SMAC Tasks},
  author = {Linghui Meng and Muning Wen and Yaodong Yang and Chenyang Le and Xiyun Li and Weinan Zhang and Ying Wen and Haifeng Zhang and Jun Wang and Bo Xu},
  journal= {arXiv preprint arXiv:2112.02845},
  year   = {2022}
}

备注

17 pages, 6 figures