中文

MinAtar:一个受 Atari 启发的用于深入且可复现强化学习实验的测试平台

机器学习 2019-06-10 v2 人工智能

摘要

Arcade Learning Environment (ALE) 是评估强化学习智能体的流行平台。其吸引力很大程度上源于 Atari 游戏展现了我们期望智能体具备的能力方面,且不对任何特定求解方法偏倚。ALE 的挑战包括(1)从原始像素提取相关信息的表示学习问题,以及(2)利用动作与奖励之间复杂、延迟关联的行为学习问题。通常我们感兴趣的研究问题更多关乎后者,但表示学习问题带来了显著的计算开销。我们引入 MinAtar(miniature Atari 的简称),一组新环境,捕捉特定 Atari 游戏的一般机制,同时简化表示复杂度以更聚焦于行为挑战。MinAtar 由五个 Atari 游戏的类似物组成:Seaquest、Breakout、Asterix、Freeway 和 Space Invaders。每个 MinAtar 环境为智能体提供 10x10xn 的二值状态表示。每个游戏在 10x10 网格上进行,n 个通道对应游戏特定对象,如 Breakout 中的球、挡板和砖块。为探究 MinAtar 所提出的行为挑战,我们评估了较小版本的 DQN 架构以及带资格迹的在线 actor-critic。由于表示学习问题被简化,我们得以以显著更少的计算开销开展实验。实验中,我们利用节省的计算时间进行了步长参数扫描并比 ALE 常规做法更多次数的运行。此类实验提升了可复现性,并使我们能得出更可信的结论。我们希望 MinAtar 能让研究者深入探究与 ALE 中固有的类似行为挑战。

关键词

引用

@article{arxiv.1903.03176,
  title  = {MinAtar: An Atari-Inspired Testbed for Thorough and Reproducible Reinforcement Learning Experiments},
  author = {Kenny Young and Tian Tian},
  journal= {arXiv preprint arXiv:1903.03176},
  year   = {2019}
}