统一基于计数的探索与内在动机
人工智能
2018-07-11 v2 机器学习
机器学习
摘要
我们考虑智能体对其环境的不确定性,以及跨观测泛化这种不确定性的问题。具体地,我们关注非表格强化学习中的探索问题。从内在动机文献中汲取灵感,我们使用密度模型来度量不确定性,并提出了一种从任意密度模型导出伪计数(pseudo-count)的新算法。该技术使得我们能够将基于计数的探索算法推广到非表格情形。我们将我们的思想应用于Atari 2600游戏,从原始像素提供合理的伪计数。我们将这些伪计数转化为内在奖励,并在包括恶名昭彰的困难游戏Montezuma's Revenge在内的若干困难游戏中获得了显著改善的探索。
引用
@article{arxiv.1606.01868,
title = {Unifying Count-Based Exploration and Intrinsic Motivation},
author = {Marc G. Bellemare and Sriram Srinivasan and Georg Ostrovski and Tom Schaul and David Saxton and Remi Munos},
journal= {arXiv preprint arXiv:1606.01868},
year = {2018}
}