中文

融合视觉感知与上下文语义以理解机器人操作任务

计算机视觉与模式识别 2020-07-28 v2

摘要

理解操作场景可使智能机器人规划恰当动作以成功完成操作任务。智能机器人以结构化方式描述实体、关系与属性,从而语义化地解释操作知识,这一点至关重要。本文提出一种实现框架,从视频片段生成高层概念性动态知识图谱。结合视觉感知与上下文语义相对应的视觉-语言模型与本体系统,以实体-关系-实体(E-R-E)与实体-属性-值(E-A-V)元组表示机器人操作知识。所提方法灵活且适用性强。利用该框架,我们展示了一个案例研究:机器人在厨房环境中执行操作动作,借助生成的动态知识图谱将视觉感知与上下文语义相桥接。

关键词

引用

@article{arxiv.1909.07459,
  title  = {Bridging Visual Perception with Contextual Semantics for Understanding Robot Manipulation Tasks},
  author = {Chen Jiang and Martin Jagersand},
  journal= {arXiv preprint arXiv:1909.07459},
  year   = {2020}
}