中文

TreeQN 与 ATreeC:用于深度强化学习的可微树结构模型

人工智能 2018-03-09 v2 机器学习 神经与进化计算 机器学习

摘要

将深度无模型强化学习与在线规划相结合,是建立在深度 RL 成功基础上的一种有前景的方法。具有前瞻树的在线规划在转移模型先验已知的环墶中已被证明是成功的。然而,在需要从数据学习转移模型的复杂环境中,所学模型的缺陷限制了它们用于规划的效用。为应对这些挑战,我们提出 TreeQN,一种可微分的、递归的、树结构的模型,可作为深度 RL 中任何具有离散动作的值函数网络的直接替代。TreeQN 通过在学习的抽象状态空间中递归应用转移模型动态构建树,然后使用树备份聚合预测的奖励与状态值来估计 Q 值。我们还提出 ATreeC,一种演员-评论家变体,它在 TreeQN 上增加 softmax 层以形成随机策略网络。两种方法均端到端训练,使得所学模型针对其在树中的实际用途进行优化。我们展示了 TreeQN 与 ATreeC 在推箱任务上优于 n-step DQN 与 A2C,并在多个 Atari 游戏上优于 n-step DQN 与值预测网络(Oh 等,2017)。此外,我们给出了消融实验,证明了不同辅助损失对学习转移模型的影响。

关键词

引用

@article{arxiv.1710.11417,
  title  = {TreeQN and ATreeC: Differentiable Tree-Structured Models for Deep Reinforcement Learning},
  author = {Gregory Farquhar and Tim Rocktäschel and Maximilian Igl and Shimon Whiteson},
  journal= {arXiv preprint arXiv:1710.11417},
  year   = {2018}
}