中文

统一基于计数的探索与内在动机

人工智能 2018-07-11 v2 机器学习 机器学习

摘要

我们考虑智能体对其环境的不确定性,以及跨观测泛化这种不确定性的问题。具体地,我们关注非表格强化学习中的探索问题。从内在动机文献中汲取灵感,我们使用密度模型来度量不确定性,并提出了一种从任意密度模型导出伪计数(pseudo-count)的新算法。该技术使得我们能够将基于计数的探索算法推广到非表格情形。我们将我们的思想应用于Atari 2600游戏,从原始像素提供合理的伪计数。我们将这些伪计数转化为内在奖励,并在包括恶名昭彰的困难游戏Montezuma's Revenge在内的若干困难游戏中获得了显著改善的探索。

关键词

引用

@article{arxiv.1606.01868,
  title  = {Unifying Count-Based Exploration and Intrinsic Motivation},
  author = {Marc G. Bellemare and Sriram Srinivasan and Georg Ostrovski and Tom Schaul and David Saxton and Remi Munos},
  journal= {arXiv preprint arXiv:1606.01868},
  year   = {2018}
}