中文

Rainbow的快速且数据高效训练:一项基于Atari的实验研究

机器学习 2021-11-22 v1

摘要

在Arcade学习环境中,Rainbow达到了与人类和现代RL算法相竞争的性能水平。然而,达到此性能水平需要大量数据和硬件资源,使得该领域的研究计算成本高昂,且在实际应用中的使用往往不可行。本文的贡献有三方面:我们(1)提出了一种改进版Rainbow,力求大幅减少Rainbow的数据、训练时间和计算需求,同时保持其竞争性能;(2)我们通过在Arcade学习环境中的实验实证展示了方法的有效性;以及(3)我们进行了若干消融研究以考察各项所提修改的影响。我们的改进版Rainbow在仅使用二十分之一的数据且单GPU上仅需7.5小时训练时间的情况下,达到了接近经典Rainbow的中位人类归一化分数。我们还提供了包含预训练模型的完整实现。

关键词

引用

@article{arxiv.2111.10247,
  title  = {Fast and Data-Efficient Training of Rainbow: an Experimental Study on Atari},
  author = {Dominik Schmidt and Thomas Schmied},
  journal= {arXiv preprint arXiv:2111.10247},
  year   = {2021}
}

备注

NeurIPS 2021, Deep Reinforcement Learning Workshop. Code at https://github.com/schmidtdominik/Rainbow