中文

改进面向POMDPs的深度强化学习

机器学习 2018-05-25 v6

摘要

深度强化学习(RL)最近成为在完全可观测环境的序列决策问题中最具竞争力的方法之一,例如计算机围棋。然而,深度RL在处理部分可观测环境方面的工作甚少。我们提出一种称为动作特定深度循环Q网络(Action-specific Deep Recurrent Q-Network, ADRQN)的新架构,以提升在部分可观测域中的学习性能。动作由全连接层编码并与卷积观测耦合形成动作-观测对。动作-观测对的时间序列随后由LSTM层整合,该层学习潜在状态,全连接层基于这些状态计算Q值,如同常规深度Q网络(DQNs)。我们在多个部分可观测域(包括闪烁的Atari游戏)中证明了新架构的有效性。

关键词

引用

@article{arxiv.1704.07978,
  title  = {On Improving Deep Reinforcement Learning for POMDPs},
  author = {Pengfei Zhu and Xin Li and Pascal Poupart and Guanghui Miao},
  journal= {arXiv preprint arXiv:1704.07978},
  year   = {2018}
}

备注

7 pages, 6 figures, 3 tables