中文

VXP:面向大规模图像-LiDAR位置识别的体素跨像素方法

计算机视觉与模式识别 2025-03-18 v2 机器人学

摘要

跨模态位置识别方法在不同环境条件和传感器设置下是灵活的 GPS 替代方案。然而,这一任务并非易事,因为从不同模态中提取一致且鲁棒的全局描述符具有挑战性。为了解决这个问题,我们提出了 Voxel-Cross-Pixel (VXP),一种新颖的相机到 LiDAR 位置识别框架,它以自监督方式强化局部相似性,并有效地将图像和 LiDAR 扫描中的全局上下文引入共享特征空间。具体而言,VXP 分三个阶段进行训练:首先,我们部署一个视觉 Transformer 来紧凑地表示输入图像。其次,我们使用新颖的几何对齐模块在基于图像和基于点云的特征空间之间建立局部对应关系。然后,我们将局部相似性聚合到一个富有表现力的共享潜在空间中。在三个基准数据集(Oxford RobotCar、ViViD++ 和 KITTI)上的大量实验表明,我们的方法大幅超越了最先进的跨模态检索。我们的评估表明,所提出的方法准确、高效且轻量。我们的项目页面位于:https://yunjinli.github.io/projects-vxp/

关键词

引用

@article{arxiv.2403.14594,
  title  = {VXP: Voxel-Cross-Pixel Large-scale Image-LiDAR Place Recognition},
  author = {Yun-Jin Li and Mariia Gladkova and Yan Xia and Rui Wang and Daniel Cremers},
  journal= {arXiv preprint arXiv:2403.14594},
  year   = {2025}
}

备注

Project page https://yunjinli.github.io/projects-vxp/