基于跨模态状态空间模型和多视角匹配的单目 LiDAR 地图视觉地点识别
计算机视觉与模式识别
2024-10-10 v1 机器人学
摘要
实现单目摄像机在预构建的 LiDAR 地图中的定位,可绕过视觉 SLAM 系统的同步映射过程,从而潜在地降低自主定位的计算开销。为此,关键挑战是跨模态地点识别,即根据在线 RGB 图像从 LiDAR 地图中检索 3D 场景(点云)。本文引入一个高效框架,用于学习 RGB 图像和点云的描述子。它以视觉状态空间模型 (VMamba) 作为主干,并采用像素-视图-场景联合训练策略进行跨模态对比学习。为解决视场差异问题,针对点云从多个均匀分布的视角生成独立描述子。随后设计一种可见 3D 点重叠策略,用于量化点云视图与 RGB 图像之间的相似性,以实现多视角监督。此外,在使用 NetVLAD 从像素级特征生成描述子时,我们补偿了几何信息的损失,并引入一种高效的多视角生成方案。在 KITI 和 KITTI-360 数据集上的实验结果表明,我们的方法在有效性和通用性方面均表现出色。接受后,我们将公开代码。
引用
@article{arxiv.2410.06285,
title = {Monocular Visual Place Recognition in LiDAR Maps via Cross-Modal State Space Model and Multi-View Matching},
author = {Gongxin Yao and Xinyang Li and Luowei Fu and Yu Pan},
journal= {arXiv preprint arXiv:2410.06285},
year = {2024}
}