中文

深度循环Q学习与深度Q学习在Minecraft简单部分可观测马尔可夫决策过程中的比较

机器学习 2019-04-12 v2 人工智能 神经与进化计算

摘要

过去几年中,深度Q学习已成功应用于广泛任务。然而,原始深度Q网络的结构不适合处理如3D视频游戏这类部分可观测环境。为此,循环层被加入深度Q网络以使其能处理过去依赖。我们在此利用Minecraft的定制优势,设计了两个可框架为部分可观测马尔可夫决策过程的非常简单任务。我们在这些任务上比较深度Q网络与深度循环Q网络,以考察后者(训练更棘手且更耗时)在智能体须应对部分可观测性时是否总是最优架构。

关键词

引用

@article{arxiv.1903.04311,
  title  = {Deep Recurrent Q-Learning vs Deep Q-Learning on a simple Partially Observable Markov Decision Process with Minecraft},
  author = {Clément Romac and Vincent Béraud},
  journal= {arXiv preprint arXiv:1903.04311},
  year   = {2019}
}