中文

面向自然人机交互的小样本视觉定位

计算机视觉与模式识别 2021-04-01 v2 人工智能

摘要

自然人机交互(HRI)是服务机器人能够在以人为中心的环境中工作的关键组成部分之一。在此类动态环境中,机器人需要理解用户的意图以成功完成任务。针对这一点,我们提出一种软件架构,可从拥挤场景中以人类用户口头指示的方式分割出目标物体。在我们系统的核心,我们采用一个多模态深度神经网络进行视觉定位。与大多数通过两步流程使用预训练目标检测器应对该挑战的定位方法不同,我们开发了能够在对未见过的数据上给出预测的单阶段零样本模型。我们在公开场景数据集收集的真实 RGB-D 数据上评估了所提模型的性能。实验结果表明,所提模型在准确率和速度方面表现良好,同时对自然语言输入的变化展现出鲁棒性。

关键词

引用

@article{arxiv.2103.09720,
  title  = {Few-Shot Visual Grounding for Natural Human-Robot Interaction},
  author = {Giorgos Tziafas and Hamidreza Kasaei},
  journal= {arXiv preprint arXiv:2103.09720},
  year   = {2021}
}

备注

6 pages, 4 figures, ICARSC2021 accepted