中文

永不放弃:学习定向探索策略

机器学习 2020-02-17 v1 机器学习

摘要

我们提出一种强化学习智能体,通过学习一系列定向探索策略来解决困难探索类游戏。我们基于情景记忆,利用智能体近期经验上的 k 近邻构造内在奖励,以训练定向探索策略,从而鼓励智能体反复重访其环境中的全部状态。我们使用自监督逆动力学模型来训练近邻查找的嵌入,将新颖性信号偏向智能体所能控制的内容。我们采用通用值函数逼近器(Universal Value Function Approximators, UVFA)框架,用同一神经网络同时学习许多具有不同探索-利用权衡的定向探索策略。通过为不同探索/利用程度使用同一神经网络,我们展示了从以探索为主的策略到有效利用策略的迁移。所提方法可集成到现代分布式强化学习智能体中运行,这些智能体由在独立环境实例上并行运行的多个 actor 收集大量经验。我们的方法在 Atari-57 套件的所有困难探索游戏中使基础智能体的性能翻倍,同时在其余游戏中保持极高分数,取得 1344.0% 的中位人类归一化分数。值得注意的是,所提方法是首个在无需演示或手工设计特征的情况下于 Pitfall! 游戏中取得非零奖励(平均分 8,400)的算法。

关键词

引用

@article{arxiv.2002.06038,
  title  = {Never Give Up: Learning Directed Exploration Strategies},
  author = {Adrià Puigdomènech Badia and Pablo Sprechmann and Alex Vitvitskyi and Daniel Guo and Bilal Piot and Steven Kapturowski and Olivier Tieleman and Martín Arjovsky and Alexander Pritzel and Andew Bolt and Charles Blundell},
  journal= {arXiv preprint arXiv:2002.06038},
  year   = {2020}
}

备注

Published as a conference paper in ICLR 2020