关于改进POMDP下的深度强化学习
机器学习
2018-05-09 v2 机器学习
摘要
深度强化学习(RL)最近已成为在完全可观测环境的序贯决策问题中(例如计算机围棋)最具竞争力的方法之一。然而,在深度RL中处理部分可观测环境的工作极少。我们提出了一种称为动作特定深度循环Q网络(ADRQN)的新架构,以提升在部分可观测域中的学习性能。动作由全连接层编码并与卷积观测耦合形成动作-观测对。随后,动作-观测对的时间序列由LSTM层整合,该层学习潜状态,基于此全连接层像常规深度Q网络(DQN)一样计算Q值。我们在多个部分可观测域(包括闪烁的Atari游戏)中证明了我们新架构的有效性。
引用
@article{arxiv.1804.06309,
title = {On Improving Deep Reinforcement Learning for POMDPs},
author = {Pengfei Zhu and Xin Li and Pascal Poupart and Guanghui Miao},
journal= {arXiv preprint arXiv:1804.06309},
year = {2018}
}
备注
We are the authors of "On Improving Deep Reinforcement Learning for POMDPs", identifier of which is arXiv:1704.07978. Last week, I wanted to update the article with new version but created a new submission which identifier is 1804.06309 by mistake