Go-Explore:一种用于困难探索问题的新方法
摘要
强化学习的一个重大挑战是智能探索,尤其在奖励稀疏或具有欺骗性时。两款Atari游戏作为此类困难探索领域的基准:Montezuma's Revenge和Pitfall。在这两款游戏上,当前的RL算法表现不佳,即便是主导困难探索领域性能提升方法的内在动机(intrinsic motivation)算法也是如此。为解决此不足,我们引入一种称为Go-Explore的新算法。它利用以下原则:(1)记住先前访问过的状态,(2)首先返回到有希望的状态(不进行探索),然后从其出发探索,以及(3)通过任何可用手段(包括引入确定性)解决模拟环境,然后通过模仿学习使其鲁棒化。这些原则的综合效应是在困难探索问题上取得戏剧性的性能改进。在Montezuma's Revenge上,Go-Explore平均得分超过43k分,几乎是此前最优(SOTA)的4倍。Go-Explore也能利用人类提供的领域知识,当辅以该知识时,在Montezuma's Revenge上平均得分超过650k分。其近1800万的最高性能超越了人类世界纪录,甚至满足最严格的“超人类”性能定义。在Pitfall上,具备领域知识的Go-Explore是首个得分高于零的算法。其近60k分的平均得分超过了人类专家表现。由于Go-Explore自动且廉价地产生高性能演示,它也优于由人类提供求解演示的模仿学习工作。Go-Explore开辟了诸多改进它并将它的洞见编织进当前RL算法的新研究方向。它也可能使许多领域中先前无法解决的困难探索问题取得进展,尤其是那些在训练中利用模拟器的领域(例如机器人学)。
引用
@article{arxiv.1901.10995,
title = {Go-Explore: a New Approach for Hard-Exploration Problems},
author = {Adrien Ecoffet and Joost Huizinga and Joel Lehman and Kenneth O. Stanley and Jeff Clune},
journal= {arXiv preprint arXiv:1901.10995},
year = {2021}
}
备注
37 pages, 14 figures; added references to Goyal et al. and Oh et al., updated reference to Colas et al; updated author emails; point readers to updated paper