中文

动态不变感知空间中的多模态视觉地点识别

计算机视觉与模式识别 2022-01-04 v2

摘要

视觉地点识别是机器人领域基本且具有挑战性的问题之一。在本文中,我们首次探索在动态不变空间中利用语义与视觉模态的多模态融合,以改善动态环境下的地点识别。为此,我们首先设计了一种新颖的深度学习架构,直接从相应的动态图像生成静态语义分割并恢复静态图像。随后,我们创新性地利用空间金字塔匹配模型将静态语义分割编码为特征向量。与此同时,静态图像使用流行的词袋模型进行编码。基于上述多模态特征,我们最终通过查询图像与目标地标的语义与视觉编码的联合相似度来衡量二者之间的相似性。大量实验证明了所提方法在动态环境下地点识别的有效性与鲁棒性。

关键词

引用

@article{arxiv.2105.07800,
  title  = {Multi-modal Visual Place Recognition in Dynamics-Invariant Perception Space},
  author = {Lin Wu and Teng Wang and Changyin Sun},
  journal= {arXiv preprint arXiv:2105.07800},
  year   = {2022}
}