中文

通过程序化关卡生成阐明深度强化学习中的泛化能力

机器学习 2018-11-30 v5 人工智能 机器学习

摘要

深度强化学习(RL)已在多种领域中展现出令人印象深刻的成果,可直接从高维感官流中学习。然而,当神经网络在固定环境中训练时,例如视频游戏中的单个关卡,它们通常会过拟合且无法泛化到新关卡。当RL模型过拟合时,即便对环境稍作修改也会导致智能体性能不佳。本文探讨了训练期间程序化生成的关卡如何提升泛化性。我们表明,对于某些游戏,程序化关卡生成能够泛化到同一分布内的新关卡。此外,通过根据智能体性能调节关卡难度,可用更少数据实现更好性能。所学行为的泛化性还在一组人工设计的关卡上进行了评估。结果表明,泛化到人工设计关卡的能力高度依赖于关卡生成器的设计。我们应用降维与聚类技术来可视化生成器的关卡分布,并分析其在多大程度上能生成类似于人类设计的关卡。

关键词

引用

@article{arxiv.1806.10729,
  title  = {Illuminating Generalization in Deep Reinforcement Learning through Procedural Level Generation},
  author = {Niels Justesen and Ruben Rodriguez Torrado and Philip Bontrager and Ahmed Khalifa and Julian Togelius and Sebastian Risi},
  journal= {arXiv preprint arXiv:1806.10729},
  year   = {2018}
}

备注

Accepted to NeurIPS Deep RL Workshop 2018