用于学习宏动作的策略性注意力写入门
人工智能
2016-06-16 v1 机器学习
摘要
我们提出了一种新颖的深度循环神经网络架构,该架构在强化学习环境中纯粹通过与环境的交互,以端到端的方式学习构建隐式计划。该网络构建一个内部计划,并在观测到环境的下一个输入时持续更新它。它还可以通过学习计划可以被坚持多久(即无需重新规划而执行的时间),将这一内部表示划分为连续的子序列。结合这些特性,所提出的模型被称为策略性注意力写入门(STRAW),能够学习从数据中纯粹学习到的、不依赖任何先验信息的高层次、时间抽象的变长宏动作。这些宏动作同时支持结构化探索和经济计算。我们通过实验证明,STRAW 通过采用时间扩展的规划策略(例如 Ms. Pacman 和 Frostbite),在多个 ATARI 游戏上取得了显著的改进。同时,它也是一个通用算法,可应用于任何序列数据。为此,我们还表明,当在文本预测任务上训练时,STRAW 自然地预测频繁的 n-gram(而非宏动作),证明了该方法的通用性。
引用
@article{arxiv.1606.04695,
title = {Strategic Attentive Writer for Learning Macro-Actions},
author = {Alexander and Vezhnevets and Volodymyr Mnih and John Agapiou and Simon Osindero and Alex Graves and Oriol Vinyals and Koray Kavukcuoglu},
journal= {arXiv preprint arXiv:1606.04695},
year = {2016}
}