中文

关系型深度强化学习

机器学习 2018-06-29 v2 机器学习

摘要

我们提出一种深度强化学习(RL)方法,通过结构化感知与关系推理,在常规方法的效率、泛化能力与可解释性上予以改进。它使用自注意力迭代推理场景中实体间的关系,并引导无模型策略。我们的结果表明,在一个称为 Box-World 的新颖导航与规划任务中,我们的智能体找到了可解释的解决方案,在样本复杂度、泛化至比训练时更复杂场景的能力以及总体性能方面均优于基线。在 StarCraft II 学习环境中,我们的智能体在六个小游戏上取得了最先进性能——在其中四个上超越人类特级大师性能。通过考虑架构归纳偏置,我们的工作为克服深度 RL 中重要但顽固的挑战开辟了新方向。

关键词

引用

@article{arxiv.1806.01830,
  title  = {Relational Deep Reinforcement Learning},
  author = {Vinicius Zambaldi and David Raposo and Adam Santoro and Victor Bapst and Yujia Li and Igor Babuschkin and Karl Tuyls and David Reichert and Timothy Lillicrap and Edward Lockhart and Murray Shanahan and Victoria Langston and Razvan Pascanu and Matthew Botvinick and Oriol Vinyals and Peter Battaglia},
  journal= {arXiv preprint arXiv:1806.01830},
  year   = {2018}
}