中文

ModaLink:面向高效图像到点云位置识别的模态统一

计算机视觉与模式识别 2024-03-28 v1 人工智能 机器人学

摘要

位置识别是机器人和自动驾驶汽车在预建地图中实现自身定位与闭环检测的重要任务。尽管单模态传感器方法已表现出令人满意的性能,但从点云数据库中检索图像的跨模态位置识别仍是一个具有挑战性的问题。现有的跨模态方法通常利用深度估计将图像转换为3D点以实现模态转换,这类方法往往计算量大且需要昂贵的标注数据进行深度监督。本文提出了一种快速且轻量级的框架,将图像和点云编码为具有位置区分度的描述符。我们设计了一个有效的视场转换模块,将点云转换为与图像类似的模态。该模块消除了深度估计的必要性,并有助于后续模块实现实时性能。我们进一步设计了一个基于非负分解的编码器,以提取点云与图像之间相互一致的语义特征。该编码器能生成更具区分度的全局描述符以用于检索。在 KITTI 数据集上的实验结果表明,我们提出的方法在实时运行下达到了 SOTA 性能。在覆盖 17 km 轨迹的 HAOMO 数据集上的额外评估进一步展示了其泛化能力。我们已在以下地址开源了方法的实现:https://github.com/haomo-ai/ModaLink.git。

关键词

引用

@article{arxiv.2403.18762,
  title  = {ModaLink: Unifying Modalities for Efficient Image-to-PointCloud Place Recognition},
  author = {Weidong Xie and Lun Luo and Nanfei Ye and Yi Ren and Shaoyi Du and Minhang Wang and Jintao Xu and Rui Ai and Weihao Gu and Xieyuanli Chen},
  journal= {arXiv preprint arXiv:2403.18762},
  year   = {2024}
}

备注

8 pages, 11 figures, conference