中文

从带解说的演示中学习奖励

计算机视觉与模式识别 2018-05-01 v1 机器人学

摘要

人类通过自然语言交流目标与愿望,可以毫不费力地“编程”彼此。相比之下,人类通过指示待达成的物体位置和姿态、提供目标配置的 RGB 图像或提供待模仿的演示来编写机器人行为。这些方法均不能跨环境变化泛化,且以笨拙的技术术语传达目标。本工作提出联合学习自然语言接地与可由自然语言表达式的感知检测器强化、并接地到机器人智能体感官输入的可指令行为策略。我们的监督信号是带解说的视觉演示(NVD),即配有语言解说(而非静默)的视觉演示。我们引入一个 NVD 数据集,其中教师在执行活动的同时详细描述它们。我们将教师的解说映射到感知奖励检测器,并用它们于仿真中训练相应行为策略。我们通过实证表明,我们的可指令智能体(i)通过利用从演示动态中挖掘的困难负样本配置,使用少量样本学习视觉奖励检测器;(ii)使用学到的视觉奖励检测器开发抓取-放置策略;(iii)受益于模仿自然语言目标表达式句法结构的物体因子化状态表示;(iv)在测试时能在自然语言指令下执行涉及新物体位于新位置的行为。

关键词

引用

@article{arxiv.1804.10692,
  title  = {Reward Learning from Narrated Demonstrations},
  author = {Hsiao-Yu Fish Tung and Adam W. Harley and Liang-Kang Huang and Katerina Fragkiadaki},
  journal= {arXiv preprint arXiv:1804.10692},
  year   = {2018}
}

备注

The work has been accepted to Conference on Computer Vision and Pattern Recognition (CVPR) 2018