中文

面向单模态视觉位置分类的多模态方法

计算机视觉与模式识别 2023-05-12 v2 机器人学

摘要

从第一人称视角单目 RGB 图像进行视觉位置分类是长期机器人导航中的基础问题。一个难点在于 RGB 图像分类器常易受空间与外观变化影响,并因域偏移(如季节、天气与光照差异)而性能退化。为应对此问题,结合 RGB 与深度(D)(如 LIDAR、雷达、立体)的多传感器融合方法近年受到欢迎。受这些多模态 RGB-D 融合工作的启发,我们探索使用近期发展的“域不变”单目深度估计所得的伪深度测量作为一种附加的伪深度模态,将单模态 RGB 图像分类任务重构为伪多模态 RGB-D 分类问题。具体而言,本文描述了一种实用的、完全自监督的训练、恰当处理、融合与分类 RGB 与伪-D 这两种模态的框架。在公开 NCLT 数据集上具有挑战性的跨域场景上的实验验证了所提框架的有效性。

关键词

引用

@article{arxiv.2305.06179,
  title  = {A Multi-modal Approach to Single-modal Visual Place Classification},
  author = {Tomoya Iwasaki and Kanji Tanaka and Kenta Tsukahara},
  journal= {arXiv preprint arXiv:2305.06179},
  year   = {2023}
}

备注

7 pages, 6 figures, 1 table