中文

深度强化学习的竞争网络架构

机器学习 2016-04-06 v3

摘要

近年来,利用深度表示进行强化学习取得了许多成功。然而,许多此类应用仍使用常规架构,如卷积网络、LSTMs或自动编码器。本文中,我们提出了一种用于无模型强化学习的新神经网络架构。我们的竞争网络表示两个独立的估计器:一个用于状态值函数,另一个用于状态依赖的动作优势函数。这种分解的主要好处是在不施加任何对底层强化学习算法的改变的情况下跨动作泛化学习。我们的结果表明,该架构在许多相似值动作存在时带来更好的策略评估。此外,竞争架构使我们的RL智能体在Atari 2600领域超越最先进水平。

关键词

引用

@article{arxiv.1511.06581,
  title  = {Dueling Network Architectures for Deep Reinforcement Learning},
  author = {Ziyu Wang and Tom Schaul and Matteo Hessel and Hado van Hasselt and Marc Lanctot and Nando de Freitas},
  journal= {arXiv preprint arXiv:1511.06581},
  year   = {2016}
}

备注

15 pages, 5 figures, and 5 tables