中文

通过语言指令学习6自由度物体位姿以抓取类别级物体

机器人学 2022-05-10 v1 计算机视觉与模式识别

摘要

本文研究通过自由形式语言指令抓取已知类别中任意物体的任务。该任务需要计算机视觉、自然语言处理和机器人学方面的技术。我们将这些学科汇聚于这一开放挑战,其对于人机交互至关重要。关键之处在于,核心挑战在于从语言指令推断物体类别,并准确估计来自已知类别的未见物体的6自由度(6-DoF)信息。相比之下,以往工作聚焦于在实例层级推断物体候选的位姿,这极大限制了其在真实场景中的应用。本文提出一种语言引导的6-DoF类别级物体定位模型,通过理解人类意图实现机器人抓取。为此,我们提出一种新颖的两阶段方法。具体而言,第一阶段通过物体的名称、属性和空间关系的语言描述在RGB图像中定位目标;第二阶段从裁剪的深度图像中提取并分割点云,并在类别层级估计完整的6-DoF物体位姿。以此方式,我们的方法可遵循人类指令定位特定物体,并估计未用于模型训练的类别已知但未见实例的完整6-DoF位姿。大量实验结果表明,我们的方法与最先进的(SOTA)语言条件抓取方法具有竞争力。重要的是,我们将该方法部署于实体机器人以验证框架在真实应用中的可用性。演示机器人实验的视频请参见补充材料。

关键词

引用

@article{arxiv.2205.04028,
  title  = {Learning 6-DoF Object Poses to Grasp Category-level Objects by Language Instructions},
  author = {Chilam Cheang and Haitao Lin and Yanwei Fu and Xiangyang Xue},
  journal= {arXiv preprint arXiv:2205.04028},
  year   = {2022}
}

备注

accepted by ICRA2022