中文

MSSPlace:基于视觉与文本语义的多传感器地点识别

计算机视觉与模式识别 2026-03-03 v1

摘要

地点识别是计算机视觉中的一个具有挑战性的任务,对于使自动驾驶车辆和机器人能够导航到 previously 访问过的环境至关重要。尽管已在可学习的多模态方法中取得了显著进展,这些方法将 onboard 摄像图像和 LiDAR 点云相结合,但这些方法在定位应用中发挥的潜力仍基本未被探索。本文研究了利用多摄像头 setup 整合多源数据进行多模态地点识别的影响,同时融合显式视觉语义和文本描述。我们提出的名为 MSSPlace 的方法利用来自多个摄像头的图像、LiDAR 点云、语义分割掩码和文本注释生成全面的地点描述符。我们采用后期融合方法整合这些模态,提供统一的表示。通过在 Oxford RobotCar 和 NCLT 数据集上的大量实验,我们系统分析了每个数据源对整体地点描述符质量的影响。我们的实验表明,与单一模态方法相比,结合来自多个传感器的数据显著提高了地点识别模型性能,并实现了最佳质量。我们还展示了,单独使用视觉或文本语义(这些是更紧凑的感知数据表示)可在地点识别中实现有前景的结果。本方法的代码已公开提供:https://github.com/alexmelekhin/MSSPlace

关键词

引用

@article{arxiv.2407.15663,
  title  = {MSSPlace: Multi-Sensor Place Recognition with Visual and Text Semantics},
  author = {Alexander Melekhin and Dmitry Yudin and Ilia Petryashin and Vitaly Bezuglyj},
  journal= {arXiv preprint arXiv:2407.15663},
  year   = {2026}
}

备注

This work has been submitted to the IEEE for possible publication