中文

具有注意力分支的多模态目标-来源分类器以理解用于抓取日常物体的模糊指令

机器人学 2019-12-30 v2 计算机视觉与模式识别

摘要

在本研究中,我们关注家庭服务机器人语境下用于抓取指令的多模态语言理解。该任务在于给定一幅图像和一句非结构化句子(如“把黄色盒子(从木柜里)拿给我”),预测用户所指示的目标物体。这具有挑战性,因为自然语言的模糊性,即相关信息可能缺失或可能存在多个候选。为解决此类任务,我们提出带注意力分支的多模态目标-来源分类器模型(MTCM-AB),它是MTCM的扩展。我们的方法使用注意力分支网络(ABN)来开发基于语言和视觉输入的多模态注意力机制。使用标准数据集的实验验证表明,MTCM-AB优于最先进的方法和MTCM。特别是在PFN-PIC数据集上,MTCM-AB平均准确率为90.1%,而人类表现为90.3%。

关键词

引用

@article{arxiv.1912.10675,
  title  = {A Multimodal Target-Source Classifier with Attention Branches to Understand Ambiguous Instructions for Fetching Daily Objects},
  author = {Aly Magassouba and Komei Sugiura and Hisashi Kawai},
  journal= {arXiv preprint arXiv:1912.10675},
  year   = {2019}
}

备注

9 pages, 5 figures, accepted for IEEE Robotics and Automation Letters