中文

深度强化学习在Atari上真的超人吗?公平比较

人工智能 2019-11-11 v5

摘要

深度强化学习(DRL)的一致且可复现的评估并不简单。在Arcade学习环境(ALE)中,环境参数(如随机性或最大允许游戏时间)的微小变化可能导致非常不同的性能。在这项工作中,我们讨论了比较在ALE上训练的不同智能体的困难。为了向可复现和可比较的DRL迈出进一步的一步,我们引入了SABER,一个用于通用强化学习算法的标准化Atari基准(Standardized Atari BEnchmark for general Reinforcement learning algorithms)。我们的方法学扩展了先前的建议,并包含完整的环境参数集以及训练和测试流程。然后我们使用SABER评估当前的最先进水平Rainbow。此外,我们引入了人类世界纪录基线,并认为先前关于DRL具有专家或超人性能的声称可能不准确。最后,我们通过将Rainbow与隐式分位数网络(IQN)扩展提出Rainbow-IQN,从而实现了新的最先进性能。源代码可用于复现。

关键词

引用

@article{arxiv.1908.04683,
  title  = {Is Deep Reinforcement Learning Really Superhuman on Atari? Leveling the playing field},
  author = {Marin Toromanoff and Emilie Wirbel and Fabien Moutarde},
  journal= {arXiv preprint arXiv:1908.04683},
  year   = {2019}
}

备注

Paper currently in review