在 Pommerman 中通过模仿与强化学习加速训练
机器学习
2019-11-14 v2 机器学习
摘要
Pommerman 模拟环境最近被开发出来以模仿经典日本游戏 Bomberman,并聚焦于多智能体设定下的对抗性玩法。我们关注为 NeurIPS 2018 竞赛开发的 Pommerman 的 2×2 团队版本。我们的方法首先通过在带噪声的专家策略上进行模仿学习来训练智能体,随后使用近端策略优化(PPO)强化学习算法。基础 PPO 方法经过修改,通过奖励塑形、基于启发式的动作过滤器和课程学习,实现从模仿学习阶段的稳定过渡。所提方法能够以合计 100,000 场训练游戏击败启发式和纯强化学习基线,显著快于文献中其他非树搜索方法。我们给出了针对模拟环境开发者提供的多个智能体的结果,包括一些我们增强过的智能体。我们包含了对不同参数的敏感性分析,并强调了某些初看起来有前景的策略的不良效应。由于 Pommerman 是一个复杂的多智能体对抗环境,此处开发的策略为若干具有部分可观测性、分散执行(无通信)以及非常稀疏且延迟奖励等特征的现实问题提供了见解。
引用
@article{arxiv.1911.04947,
title = {Accelerating Training in Pommerman with Imitation and Reinforcement Learning},
author = {Hardik Meisheri and Omkar Shelke and Richa Verma and Harshad Khadilkar},
journal= {arXiv preprint arXiv:1911.04947},
year = {2019}
}
备注
Presented at Deep Reinforcement Learning workshop, NeurIPS-2019