中文

深度抽象 Q 网络

机器学习 2018-08-28 v2 人工智能

摘要

我们研究在具有长视野和稀疏奖励的高维领域上的学习与规划问题。近期的方法在许多 Atari 2600 领域中取得了巨大成功。然而,具有长视野和稀疏奖励的领域,如 Montezuma's Revenge 和 Venture,对现有方法而言仍具挑战性。使用抽象的方法(Dietterich 2000; Sutton, Precup, and Singh 1999)已被证明在解决长视野问题方面是有用的。我们将深度强化学习的最新技术与使用专家提供的状态抽象的现有基于模型的方法相结合。我们构建了能够阐明长视野、稀疏奖励和高维输入问题的玩具领域,并表明我们的算法在这些领域上显著优于先前的方法。我们基于抽象的方法在 Montezuma's Revenge 和 Venture 上优于 Deep Q-Networks (Mnih et al. 2015),并表现出先前方法所缺乏的回溯行为。

关键词

引用

@article{arxiv.1710.00459,
  title  = {Deep Abstract Q-Networks},
  author = {Melrose Roderick and Christopher Grimm and Stefanie Tellex},
  journal= {arXiv preprint arXiv:1710.00459},
  year   = {2018}
}