中文

关于街机学习环境中的基于奖励增广的探索方法

机器学习 2021-09-24 v1

摘要

应用于 Atari 2600 游戏对战的强化学习探索研究,一直强调解决困难的探索问题,例如 Montezuma's Revenge(Bellemare 等人,2016)。近来,通过增强环境奖励来进行探索的基于奖励(bonus-based)探索方法,已在此类领域达到超越人类平均水平的性能。本文中,我们在一个共同评估框架下重新评估流行的基于奖励的探索方法。我们将 Rainbow(Hessel 等人,2018)与不同探索奖励相结合,并在 Montezuma's Revenge、Bellemare 等人具有稀疏奖励的困难探索游戏集,以及整个 Atari 2600 套件上评估其性能。我们发现,尽管探索奖励在 Montezuma's Revenge 上带来更高分数,但相对于更简单的 ϵ\epsilon-greedy 方案并未提供有意义的增益。事实上,我们发现在该游戏上表现最好的方法,在简单探索的 Atari 2600 游戏上往往逊于 ϵ\epsilon-greedy。我们发现即便为这些简单探索游戏调整超参数,结论依然成立。最后,我们发现所调查的方法无一从额外训练样本(10 亿帧,对比 Rainbow 的 2 亿帧)中受益,于 Bellemare 等人的困难探索游戏上。我们的结果表明,近期在 Montezuma's Revenge 上的进展或许更应归因于架构改变,而非更好的探索方案;并且 Atari 2600 游戏探索研究的真实进展速度可能因单一领域上的良好结果而被掩盖。

关键词

引用

@article{arxiv.2109.11052,
  title  = {On Bonus-Based Exploration Methods in the Arcade Learning Environment},
  author = {Adrien Ali Taïga and William Fedus and Marlos C. Machado and Aaron Courville and Marc G. Bellemare},
  journal= {arXiv preprint arXiv:2109.11052},
  year   = {2021}
}

备注

Full version of arXiv:1908.02388