评估通用视频游戏中的泛化能力
人工智能
2020-05-25 v1
摘要
通用视频游戏人工智能 (GVGAI) 竞赛已举办多年,设有多个赛道。本文聚焦于 GVGAI 学习赛道的挑战,该赛道选择 3 款游戏,提供 2 个关卡用于训练,而保留 3 个隐藏关卡用于评估。这种设置对当前的强化学习 (RL) 算法构成了严峻挑战,因为它们通常需要更多的数据。本研究考察了在 GVGAI 框架提供的 5 个关卡中最多 2 个关卡上训练的 3 个版本的优势演员-评论家 (A2C) 算法,并比较了它们在所有关卡上的性能。所选游戏子集具有不同的特性,如随机性、奖励分布和目标。我们发现随机性改善了泛化能力,但过多的随机性可能导致算法无法学会训练关卡。训练关卡的质量也很重要,不同的训练关卡集可以提升在所有关卡上的泛化能力。在 GVGAI 竞赛中,智能体根据其胜率以及随后在游戏中获得的分数进行评分。我们发现,仅使用游戏提供的奖励可能无法鼓励获胜。
引用
@article{arxiv.2005.11247,
title = {Evaluating Generalisation in General Video Game Playing},
author = {Martin Balla and Simon M. Lucas and Diego Perez-Liebana},
journal= {arXiv preprint arXiv:2005.11247},
year = {2020}
}
备注
accepted for publication in IEEE Conference on Games (CoG) 2020