通过程序化关卡生成阐明深度强化学习中的泛化能力
机器学习
2018-11-30 v5 人工智能
机器学习
摘要
深度强化学习(RL)已在多种领域中展现出令人印象深刻的成果,可直接从高维感官流中学习。然而,当神经网络在固定环境中训练时,例如视频游戏中的单个关卡,它们通常会过拟合且无法泛化到新关卡。当RL模型过拟合时,即便对环境稍作修改也会导致智能体性能不佳。本文探讨了训练期间程序化生成的关卡如何提升泛化性。我们表明,对于某些游戏,程序化关卡生成能够泛化到同一分布内的新关卡。此外,通过根据智能体性能调节关卡难度,可用更少数据实现更好性能。所学行为的泛化性还在一组人工设计的关卡上进行了评估。结果表明,泛化到人工设计关卡的能力高度依赖于关卡生成器的设计。我们应用降维与聚类技术来可视化生成器的关卡分布,并分析其在多大程度上能生成类似于人类设计的关卡。
引用
@article{arxiv.1806.10729,
title = {Illuminating Generalization in Deep Reinforcement Learning through Procedural Level Generation},
author = {Niels Justesen and Ruben Rodriguez Torrado and Philip Bontrager and Ahmed Khalifa and Julian Togelius and Sebastian Risi},
journal= {arXiv preprint arXiv:1806.10729},
year = {2018}
}
备注
Accepted to NeurIPS Deep RL Workshop 2018