基于神经密度模型的计数的探索
人工智能
2017-06-15 v2
摘要
Bellemare 等人 (2016) 引入了源自密度模型的伪计数概念,以将基于计数的探索推广至非表格强化学习。该伪计数用于为 DQN 智能体生成探索奖励,结合混合 Monte Carlo 更新,足以在 Atari 2600 游戏 Montezuma's Revenge 上达到 SOTA。我们研究了他们工作中遗留的两个问题:第一,密度模型的质量对探索有多重要?第二,Monte Carlo 更新在探索中起什么作用?我们通过展示使用 PixelCNN(一种先进的图像神经密度模型)来提供伪计数,回答了第一个问题。具体而言,我们检验了在违反模型假设时,调整 Bellemare 等人的方法所面临的固有困难。其结果是一种更实用、更通用且无需特殊装置的算法。我们将 PixelCNN 伪计数与不同的智能体架构相结合,在几款困难的 Atari 游戏上大幅提升了 SOTA。一个令人惊讶的发现是,混合 Monte Carlo 更新在最稀疏的设置(包括 Montezuma's Revenge)下是探索的强大促进因素。
引用
@article{arxiv.1703.01310,
title = {Count-Based Exploration with Neural Density Models},
author = {Georg Ostrovski and Marc G. Bellemare and Aaron van den Oord and Remi Munos},
journal= {arXiv preprint arXiv:1703.01310},
year = {2017}
}