中文

Predictron:端到端学习与规划

机器学习 2017-07-21 v3 人工智能 神经与进化计算

摘要

人工智能的关键挑战之一是学习在规划背景下有效的模型。在本文中我们介绍了 predictron 架构。predictron 由一个完全抽象的模型组成,该模型由马尔可夫奖励过程表示,可以被滚动向前多个“想象”的规划步骤。predictron 的每次前向传递在多个规划深度上累积内部奖励和值。predictron 以端到端方式训练,以使这些累积值准确近似真实值函数。我们将 predictron 应用于程序化生成的随机迷宫和台球游戏模拟器。predictron 比传统的深度神经网络架构产生了显著更准确的预测。

关键词

引用

@article{arxiv.1612.08810,
  title  = {The Predictron: End-To-End Learning and Planning},
  author = {David Silver and Hado van Hasselt and Matteo Hessel and Tom Schaul and Arthur Guez and Tim Harley and Gabriel Dulac-Arnold and David Reichert and Neil Rabinowitz and Andre Barreto and Thomas Degris},
  journal= {arXiv preprint arXiv:1612.08810},
  year   = {2017}
}

备注

Camera-ready version, ICML 2017, with supplement