中文

先返回,再探索

人工智能 2021-09-17 v6

摘要

强化学习的愿景是通过仅指定高层奖励函数来自主解决复杂的序贯决策问题。然而,当简单直观的奖励提供稀疏且具欺骗性的反馈时(这屡见不鲜),强化学习算法便陷入困境。避免这些陷阱需要彻底探索环境,但构建能够做到这一点的算法仍是该领域的核心挑战之一。我们假设,有效探索的主要障碍源于算法遗忘如何到达先前访问过的状态(“脱离”)以及未能在探索前先返回某一状态(“出轨”)。我们提出 Go-Explore,一类通过显式记忆有前景状态并在有意探索前先返回此类状态这一简单原则直接应对这两大挑战的算法。Go-Explore 解决了所有此前未解决的 Atari 游戏,并在所有困难探索游戏上超越现有最优水平,在蒙特祖玛的复仇与 Pitfall 等宏大挑战上实现数量级提升。我们还展示了 Go-Explore 在稀疏奖励拾放机器人任务上的实用潜力。此外,我们表明添加目标条件策略可进一步提升 Go-Explore 的探索效率,并使其能在整个训练过程中处理随机性。Go-Explore 带来的显著性能提升表明,记忆状态、返回状态并从中探索的简单原则是一种强大且通用的探索方法,这一洞见可能对真正智能学习体的创建至关重要。

关键词

引用

@article{arxiv.2004.12919,
  title  = {First return, then explore},
  author = {Adrien Ecoffet and Joost Huizinga and Joel Lehman and Kenneth O. Stanley and Jeff Clune},
  journal= {arXiv preprint arXiv:2004.12919},
  year   = {2021}
}

备注

47 pages, 14 figures, 4 tables; reorganized sections and modified SI text extensively; added reference to the published version, changed title to published title; added reference to published unformatted pdf