融合范围图和鸟瞰图的跨模态视觉地点识别
计算机视觉与模式识别
2025-03-03 v2
摘要
图像到点云跨模态视觉地点识别(VPR)是一项具有挑战性的任务,其中查询对象为 RGB 图像,而数据库样本为 LiDAR 点云。与单模态 VPR 相比,这种方法受益于 RGB 摄像机的广泛可用性,以及点云在提供准确空间几何和距离信息方面的鲁棒性。然而,当前方法依赖于捕获垂直或水平视场的中间模态,限制了其充分利用两种传感器互补信息的能力。本文提出一种创新的初始检索 + 重排序方法,有效组合来自范围图(或 RGB 图像)和鸟瞰图(Bird's Eye View, BEV)图像的信息。我们的做法仅依赖计算高效的全局描述符相似性搜索过程即可实现重排序。此外,我们引入一种新颖的相似度标签监督技术,以最大化有限训练数据的实用性。具体而言,我们采用点平均距离来近似外观相似性,并在基本三元组损失中纳入基于相似度差异的自适应间隔。KITTI 数据集上的实验结果表明,我们的方法显著优于最先进的方法。
引用
@article{arxiv.2502.11742,
title = {Range and Bird's Eye View Fused Cross-Modal Visual Place Recognition},
author = {Jianyi Peng and Fan Lu and Bin Li and Yuan Huang and Sanqing Qu and Guang Chen},
journal= {arXiv preprint arXiv:2502.11742},
year = {2025}
}