中文

程序化生成环境中样本高效的逆强化学习

机器学习 2020-12-07 v1 人工智能

摘要

深度强化学习在可以人工设计奖励函数的领域中取得了非常好的结果。与此同时,社区内对使用基于程序化内容生成(PCG)的游戏作为基准环境日益增长的兴趣,因为这类环境非常适合研究智能体在域偏移下的过拟合与泛化。逆强化学习(IRL)则可以从专家演示中外推奖励函数,即使在高度维问题上也能取得良好结果,然而目前还没有将这些技术应用于程序化生成环境的例子。这主要是由于寻找一个良好奖励模型所需的演示数量。我们提出了一种基于对抗逆强化学习的技术,可显著减少 PCG 游戏中对专家演示的需求。通过使用具有有限初始种子关卡集合的环境,加上一些稳定训练的修改,我们展示了我们的方法 DE-AIRL 具有演示高效性,并且仍能够外推可泛化到完全程序化域的奖励函数。我们在两个程序化环境 MiniGrid 和 DeepCrawl 上的多种任务中证明了我们技术的有效性。

关键词

引用

@article{arxiv.2012.02527,
  title  = {Demonstration-efficient Inverse Reinforcement Learning in Procedurally Generated Environments},
  author = {Alessandro Sestini and Alexander Kuhnle and Andrew D. Bagdanov},
  journal= {arXiv preprint arXiv:2012.02527},
  year   = {2020}
}

备注

Presented at the AAAI-21 Workshop on Reinforcement Learning in Games