中文

用于部分可观测马尔可夫决策过程的深度递归Q学习

机器学习 2017-01-13 v4

摘要

深度强化学习已为复杂任务产生了熟练的控制器。然而,这些控制器记忆有限,且依赖于在每个决策点都能感知完整的游戏画面。为了解决这些缺点,本文研究了通过用递归LSTM替换第一个卷积后全连接层,向深度Q网络(DQN)添加递归性的效果。由此产生的深度递归Q网络(DRQN),尽管在每个时间步只能看到单帧画面,却能成功地随时间整合信息,并在标准Atari游戏和具有闪烁游戏画面的部分可观测等价游戏上复现了DQN的性能。此外,当用部分观测训练并用逐渐更完整的观测评估时,DRQN的性能作为可观测性的函数而提升。反之,当用完整观测训练并用部分观测评估时,DRQN的性能下降程度小于DQN。因此,给定相同长度的历史,递归性是堆叠DQN输入层中帧历史的一种可行替代方案,并且虽然递归性在学习玩游戏时不带来系统性优势,但如果观测质量在评估时发生变化,递归网络能更好地适应。

关键词

引用

@article{arxiv.1507.06527,
  title  = {Deep Recurrent Q-Learning for Partially Observable MDPs},
  author = {Matthew Hausknecht and Peter Stone},
  journal= {arXiv preprint arXiv:1507.06527},
  year   = {2017}
}