用确定性可微模仿学习训练神经解析器
机器学习
2018-09-20 v2 人工智能
计算机视觉与模式识别
机器人学
机器学习
摘要
我们探索将空间任务分解为片段的学习问题,以绘画机器人覆盖大型物体为例。受经典决策树算法对其输入空间构建结构化划分能力的启发,我们将物体分解为片段的问题表述为一种解析方法。我们提出见解:将物体分解为片段的解析树的推导与 ID3 构建的决策树极为相似,而在有真实标注时可行。我们学习模仿专家解析预言机,使我们的神经解析器能够泛化到无真实标注的自然图像解析。我们引入了一种新颖的确定性策略梯度更新,DRAG(即 DeteRministically AGgrevate),作为 AggreVaTeD 的确定性 actor-critic 变体,来训练我们的神经解析器。从另一角度看,我们的方法是适用于模仿学习设置的确定性策略梯度变体。通过 DRAG 训练神经解析器所提供的确定性策略表示,使其性能超越最先进的模仿与强化学习方法。
引用
@article{arxiv.1806.07822,
title = {Learning Neural Parsers with Deterministic Differentiable Imitation Learning},
author = {Tanmay Shankar and Nicholas Rhinehart and Katharina Muelling and Kris M. Kitani},
journal= {arXiv preprint arXiv:1806.07822},
year = {2018}
}
备注
Accepted to Conference on Robot Learning, CoRL 2018