具有注意力分支的多模态目标-来源分类器以理解用于抓取日常物体的模糊指令
机器人学
2019-12-30 v2 计算机视觉与模式识别
摘要
在本研究中,我们关注家庭服务机器人语境下用于抓取指令的多模态语言理解。该任务在于给定一幅图像和一句非结构化句子(如“把黄色盒子(从木柜里)拿给我”),预测用户所指示的目标物体。这具有挑战性,因为自然语言的模糊性,即相关信息可能缺失或可能存在多个候选。为解决此类任务,我们提出带注意力分支的多模态目标-来源分类器模型(MTCM-AB),它是MTCM的扩展。我们的方法使用注意力分支网络(ABN)来开发基于语言和视觉输入的多模态注意力机制。使用标准数据集的实验验证表明,MTCM-AB优于最先进的方法和MTCM。特别是在PFN-PIC数据集上,MTCM-AB平均准确率为90.1%,而人类表现为90.3%。
引用
@article{arxiv.1912.10675,
title = {A Multimodal Target-Source Classifier with Attention Branches to Understand Ambiguous Instructions for Fetching Daily Objects},
author = {Aly Magassouba and Komei Sugiura and Hisashi Kawai},
journal= {arXiv preprint arXiv:1912.10675},
year = {2019}
}
备注
9 pages, 5 figures, accepted for IEEE Robotics and Automation Letters