中文

用于程序化内容生成的对抗强化学习

机器学习 2021-06-11 v2 人工智能

摘要

我们提出一种新方法 ARLPCG:用于程序化内容生成的对抗强化学习(Adversarial Reinforcement Learning for Procedural Content Generation),它以辅助输入作为控制变量,程序化生成并测试此前未见的环境。在全新环境中训练 RL 智能体是众所周知的困难任务。一种流行的方法是程序化生成不同环境以提升训练智能体的泛化能力。ARLPCG 则部署了一个对抗模型,包含一个 PCG RL 智能体(称为生成器)和一个求解 RL 智能体(称为求解器)。生成器基于求解器的表现获得奖励信号,从而鼓励环境设计具有挑战性但非不可解。为了进一步驱动环境生成的多样性和可控性,我们提出为生成器使用辅助输入。其益处有两方面:首先,求解器通过生成器生成的挑战获得更好的泛化;其次,训练好的生成器可用作新颖环境的创造者,且与求解器结合可证明为可解。我们创建了两类 3D 环境来验证模型,代表两种流行游戏类型:第三人称平台跳跃和竞速游戏。在这些案例中,我们表明 ARLPCG 具有显著更好的求解率,且辅助输入使关卡创建在某种程度上可控。相关结果视频合集请访问 https://youtu.be/z7q2PtVsT0I。

关键词

引用

@article{arxiv.2103.04847,
  title  = {Adversarial Reinforcement Learning for Procedural Content Generation},
  author = {Linus Gisslén and Andy Eakins and Camilo Gordillo and Joakim Bergdahl and Konrad Tollmar},
  journal= {arXiv preprint arXiv:2103.04847},
  year   = {2021}
}

备注

8 pages, 6 figures (11 subfigures)