使黑箱变灰:理解深度Q网络(DQNs)
机器学习
2017-04-25 v4 人工智能
神经与进化计算
摘要
近年来,将深度表征用于强化学习受到越来越多的关注。本文中,我们提出一种方法和工具,以非盲方式分析深度Q网络(DQNs)。此外,我们提出一个新模型——半聚合马尔可夫决策过程(SAMDP),以及一种自动学习该模型的算法。SAMDP模型使我们能够直接从特征中识别时空抽象,并可在未来工作中用作子目标检测器。利用我们的工具,我们揭示了DQNs学习的特征以层次化方式聚合状态空间,这解释了其成功。此外,我们能够理解并描述DQNs针对三款不同Atari2600游戏所学到的策略,并提出了在强化学习中解释、调试和优化深度神经网络的方法。
引用
@article{arxiv.1602.02658,
title = {Graying the black box: Understanding DQNs},
author = {Tom Zahavy and Nir Ben Zrihem and Shie Mannor},
journal= {arXiv preprint arXiv:1602.02658},
year = {2017}
}