基于持续对局的训练在 Pommerman 中的应用:技术报告
人工智能
2018-12-19 v1
摘要
持续学习是智能体在多个任务中不断提升其能力的能力。尽管近期持续学习文献中的工作大多聚焦于开发特定的损失函数或解释情景记忆与神经可塑性的专用神经网络结构,我们从训练机制的角度研究持续学习。具体而言,我们提出一种基于持续对局的训练(COMBAT)框架,用于在 Pommerman(一个无通信的部分可观测多智能体环境)中训练一群优势 actor-critic(A2C)智能体。遵循 COMBAT 框架,我们训练了一个名为 Navocado 的智能体,其在 NeurIPS 2018 Pommerman 竞赛中获得排名第一学习智能体的称号。我们的智能体有两个关键特征值得提及。首先,我们的智能体未从任何示范中学习。其次,我们的智能体具有高度可复现性。作为技术报告,我们阐明了状态空间、动作空间、奖励的设计,以及最为重要的、我们 Pommerman 智能体的 COMBAT 框架。我们在实验中表明,Pommerman 是研究持续学习的理想环境,且智能体可通过持续学习新技能而不遗忘旧技能来提升其表现。最后,Pommerman 竞赛中的结果验证了我们的智能体在与各类对手竞争时的鲁棒性。
引用
@article{arxiv.1812.07297,
title = {Continual Match Based Training in Pommerman: Technical Report},
author = {Peng Peng and Liang Pang and Yufeng Yuan and Chao Gao},
journal= {arXiv preprint arXiv:1812.07297},
year = {2018}
}
备注
8 pages, 7 figures