价值传播网络
人工智能
2019-03-26 v2 机器学习
摘要
我们提出了价值传播(VProp),这是一组基于价值迭代构建的参数高效的可微规划模块。它可以通过强化学习成功训练以解决未见任务,具备泛化到更大地图尺寸的能力,并且能够学习在动态环境中导航。我们表明,当环境还包含随机元素时,这些模块能够实现学习规划,为各种交互式导航问题构建低级尺寸无关的规划器提供了一个成本高效的学习系统。我们在 MazeBase 网格世界的静态和动态配置、几种不同尺寸的随机生成环境,以及具有更复杂动态且以像素作为输入的 StarCraft 导航场景上进行了评估。
引用
@article{arxiv.1805.11199,
title = {Value Propagation Networks},
author = {Nantas Nardelli and Gabriel Synnaeve and Zeming Lin and Pushmeet Kohli and Philip H. S. Torr and Nicolas Usunier},
journal= {arXiv preprint arXiv:1805.11199},
year = {2019}
}
备注
Updated to match ICLR 2019 OpenReview's version