中文

使黑箱变灰:理解深度Q网络(DQNs)

机器学习 2017-04-25 v4 人工智能 神经与进化计算

摘要

近年来,将深度表征用于强化学习受到越来越多的关注。本文中,我们提出一种方法和工具,以非盲方式分析深度Q网络(DQNs)。此外,我们提出一个新模型——半聚合马尔可夫决策过程(SAMDP),以及一种自动学习该模型的算法。SAMDP模型使我们能够直接从特征中识别时空抽象,并可在未来工作中用作子目标检测器。利用我们的工具,我们揭示了DQNs学习的特征以层次化方式聚合状态空间,这解释了其成功。此外,我们能够理解并描述DQNs针对三款不同Atari2600游戏所学到的策略,并提出了在强化学习中解释、调试和优化深度神经网络的方法。

关键词

引用

@article{arxiv.1602.02658,
  title  = {Graying the black box: Understanding DQNs},
  author = {Tom Zahavy and Nir Ben Zrihem and Shie Mannor},
  journal= {arXiv preprint arXiv:1602.02658},
  year   = {2017}
}