中文

基于元学习的记忆视觉-语音室内导航多模态聚合方法

计算机视觉与模式识别 2020-09-02 v1

摘要

视觉与语音是智能体交互与学习的两个重要关键。本文提出一种新颖的室内导航模型,称为记忆视觉-语音室内导航(Memory Vision-Voice Indoor Navigation, MVV-IN),其接收语音指令并分析视觉观测的多模态信息,以增强机器人对环境的理解。我们使用由第一视角单目相机拍摄的单一RGB图像。我们还应用自注意力机制使智能体聚焦于关键区域。记忆对于智能体避免不必要地重复某些任务以及充分适应新场景十分重要,因此我们利用元学习。我们尝试了从视觉观测中提取的多种功能特征。对比实验证明我们的方法优于最先进的基线。

关键词

引用

@article{arxiv.2009.00402,
  title  = {Multimodal Aggregation Approach for Memory Vision-Voice Indoor Navigation with Meta-Learning},
  author = {Liqi Yan and Dongfang Liu and Yaoxian Song and Changbin Yu},
  journal= {arXiv preprint arXiv:2009.00402},
  year   = {2020}
}

备注

8 pages, 6 figures, 2 tables, accepted at 2020 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2020)