中文

基于后继表示的计数式探索

机器学习 2019-11-27 v4 人工智能 机器学习

摘要

本文提出了一种简单的强化学习(RL)探索方法,该方法使我们在表格情形下能够推导出理论上有保证的算法,同时也可扩展到需要函数近似的场景。我们的方法基于后继表示(SR),其最初是作为一种通过后继状态的相似性来定义状态泛化的表示而引入的。本文我们表明,SR的范数在学习过程中可用作奖励奖励(reward bonus)以激励探索。为了更好地理解SR范数的这种瞬态行为,我们引入了次随机后继表示(SSR),并证明它隐式地计数了每个状态(或特征)被观测到的次数。我们利用这一结果提出了一种性能与某些理论样本高效方法相当的算法。最后,我们将这些思想扩展到一种深度RL算法,并表明在低样本复杂度情形下,它在Atari 2600游戏中达到了最先进的性能。

关键词

引用

@article{arxiv.1807.11622,
  title  = {Count-Based Exploration with the Successor Representation},
  author = {Marlos C. Machado and Marc G. Bellemare and Michael Bowling},
  journal= {arXiv preprint arXiv:1807.11622},
  year   = {2019}
}

备注

This paper appears in the Proceedings of the 34th AAAI Conference on Artificial Intelligence (AAAI 2020)