中文

用确定性可微模仿学习训练神经解析器

机器学习 2018-09-20 v2 人工智能 计算机视觉与模式识别 机器人学 机器学习

摘要

我们探索将空间任务分解为片段的学习问题,以绘画机器人覆盖大型物体为例。受经典决策树算法对其输入空间构建结构化划分能力的启发,我们将物体分解为片段的问题表述为一种解析方法。我们提出见解:将物体分解为片段的解析树的推导与 ID3 构建的决策树极为相似,而在有真实标注时可行。我们学习模仿专家解析预言机,使我们的神经解析器能够泛化到无真实标注的自然图像解析。我们引入了一种新颖的确定性策略梯度更新,DRAG(即 DeteRministically AGgrevate),作为 AggreVaTeD 的确定性 actor-critic 变体,来训练我们的神经解析器。从另一角度看,我们的方法是适用于模仿学习设置的确定性策略梯度变体。通过 DRAG 训练神经解析器所提供的确定性策略表示,使其性能超越最先进的模仿与强化学习方法。

关键词

引用

@article{arxiv.1806.07822,
  title  = {Learning Neural Parsers with Deterministic Differentiable Imitation Learning},
  author = {Tanmay Shankar and Nicholas Rhinehart and Katharina Muelling and Kris M. Kitani},
  journal= {arXiv preprint arXiv:1806.07822},
  year   = {2018}
}

备注

Accepted to Conference on Robot Learning, CoRL 2018