利用有限数据精通Atari游戏
机器学习
2021-12-14 v2 人工智能
计算机视觉与模式识别
机器人学
摘要
强化学习在许多应用中已取得巨大成功。然而,样本效率仍是一项关键挑战,主流方法需要数百万(甚至数十亿)环境步数进行训练。近来,基于图像的样本高效RL算法取得显著进展;但Atari游戏基准上稳定的人类水平表现仍是一项难以达成的目标。我们提出一种构建于MuZero之上的样本高效基于模型的视觉RL算法,命名为EfficientZero。我们的方法在Atari 100k基准上仅用两小时实时游戏经验即取得194.3%平均人类表现与109.0%中位表现,并在DMControl 100k基准的部分任务上超越SOTA(state of the art)的SAC。这是首次有算法以如此少的数据在Atari游戏上达到超人类表现。EfficientZero的表现也接近DQN在2亿帧时的表现,而我们消耗的数据量少500倍。EfficientZero的低样本复杂度与高性能可使RL更贴近现实应用。我们以易于理解的方式实现该算法,代码见https://github.com/YeWR/EfficientZero。我们希望它能加速更广泛社区中基于MCTS的RL算法研究。
引用
@article{arxiv.2111.00210,
title = {Mastering Atari Games with Limited Data},
author = {Weirui Ye and Shaohuai Liu and Thanard Kurutach and Pieter Abbeel and Yang Gao},
journal= {arXiv preprint arXiv:2111.00210},
year = {2021}
}
备注
Published at NeurIPS 2021; Homepage: https://yewr.github.io/projects/efficientzero/