Predictron:端到端学习与规划
机器学习
2017-07-21 v3 人工智能
神经与进化计算
摘要
人工智能的关键挑战之一是学习在规划背景下有效的模型。在本文中我们介绍了 predictron 架构。predictron 由一个完全抽象的模型组成,该模型由马尔可夫奖励过程表示,可以被滚动向前多个“想象”的规划步骤。predictron 的每次前向传递在多个规划深度上累积内部奖励和值。predictron 以端到端方式训练,以使这些累积值准确近似真实值函数。我们将 predictron 应用于程序化生成的随机迷宫和台球游戏模拟器。predictron 比传统的深度神经网络架构产生了显著更准确的预测。
引用
@article{arxiv.1612.08810,
title = {The Predictron: End-To-End Learning and Planning},
author = {David Silver and Hado van Hasselt and Matteo Hessel and Tom Schaul and Arthur Guez and Tim Harley and Gabriel Dulac-Arnold and David Reichert and Neil Rabinowitz and Andre Barreto and Thomas Degris},
journal= {arXiv preprint arXiv:1612.08810},
year = {2017}
}
备注
Camera-ready version, ICML 2017, with supplement