中文

在Atari深度强化学习数据效率评估中使用恰当基线的重要性

机器学习 2020-04-01 v2 机器学习

摘要

强化学习(RL)在过去几年中取得了巨大进展。然而,RL界的共识是,当前使用的方法尽管有诸多优点,却存在极端的数据低效问题,尤其是在Atari这类丰富视觉领域中。为规避此问题,引入了新颖的方法,其常声称比最先进DQN算法的流行变体高效得多。然而,本文中我们证明这些新提出的技术只是在实验中使用了不公平的基线。即,我们表明效率上的实际提升来自于允许算法对每个数据样本进行更多训练更新,而非采用了新方法。通过允许DQN更频繁地执行网络更新,我们以往往更低的复杂度和计算成本的一小部分,取得了与近期提出的进展相似或更好的结果。此外,基于本研究的结果,我们认为类似于本文所给出的改进DQN的智能体应作为任何未来旨在提升深度强化学习样本效率工作的基线。

关键词

引用

@article{arxiv.2003.10181,
  title  = {Importance of using appropriate baselines for evaluation of data-efficiency in deep reinforcement learning for Atari},
  author = {Kacper Kielak},
  journal= {arXiv preprint arXiv:2003.10181},
  year   = {2020}
}

备注

11 pages, 2 figures. Paper has been originally submitted to ICLR2020 on 25 Sep 2019