中文

面向多模态观察学习机器人的家庭动作常识所需的语义约束表示

机器人学 2021-03-04 v1

摘要

观察学习(LfO)范式使机器人能够通过观察人类演示动作来学习如何执行动作。以往LfO研究主要关注工业领域,其中仅包含操纵工具与机器人工作环境之间的可观测物理约束。为将该范式扩展到家庭领域(其包含源自人类常识的不可观测约束),我们引入了语义约束的思想。语义约束通过定义与想象语义环境的接触来表示,类似于物理约束。我们深入研究了理解和区分不同类型物理与语义约束所需的充分必要接触状态及状态转移集合。随后我们将约束表示应用于分析热门家庭YouTube视频和真实家庭烹饪记录中的各类动作。我们进一步将频繁出现的约束模式归类为物理、语义和多阶段任务组,并验证这些组不仅是必要的,更是覆盖标准家庭动作的充分集合。最后,我们利用文本输入进行了初步实验,探索结合言语与视觉输入来识别任务组的可能性。我们的结果为在机器人教学文献中融入常识提供了有前景的方向。

关键词

引用

@article{arxiv.2103.02201,
  title  = {Semantic constraints to represent common sense required in household actions for multi-modal Learning-from-observation robot},
  author = {Katsushi Ikeuchi and Naoki Wake and Riku Arakawa and Kazuhiro Sasabuchi and Jun Takamatsu},
  journal= {arXiv preprint arXiv:2103.02201},
  year   = {2021}
}

备注

18 pages, 31 figures