TLeague:基于竞争自博弈的分布式多智能体强化学习框架
机器学习
2020-12-01 v2 人工智能
多智能体系统
摘要
基于竞争自博弈(CSP)的多智能体强化学习(MARL)近年来取得了惊人突破。在包括Dota 2、王者荣耀、Quake III、星际争霸II等若干基准上实现了强人工智能。尽管取得成功,MARL训练极其耗费数据,通常需要在训练期间从环境中观测数十亿(甚至数万亿)帧才能学习到高性能智能体。这给研究人员或工程师带来了不小的困难,并阻碍了MARL在更广泛现实问题中的应用。为解决此问题,本文中我们描述了一个称为TLeague的框架,其旨在大规模训练并实现若干主流CSP-MARL算法。该训练可部署于单机或混合机器(CPU与GPU)集群,其中标准Kubernetes以云原生方式得到支持。TLeague在执行分布式训练时实现了高吞吐量与合理的扩展比。得益于模块化设计,它也易于扩展以求解其他多智能体问题或实现与验证MARL算法。我们给出了在星际争霸II、ViZDoom和Pommerman上的实验以展示TLeague的效率与有效性。代码已开源,可在 https://github.com/tencent-ailab/tleague_projpage 获取。
引用
@article{arxiv.2011.12895,
title = {TLeague: A Framework for Competitive Self-Play based Distributed Multi-Agent Reinforcement Learning},
author = {Peng Sun and Jiechao Xiong and Lei Han and Xinghai Sun and Shuxing Li and Jiawei Xu and Meng Fang and Zhengyou Zhang},
journal= {arXiv preprint arXiv:2011.12895},
year = {2020}
}
备注
21 pages, 3 figures, technical report