中文

UniLoc:迈向使用任意单一模态的通用位置识别

计算机视觉与模式识别 2024-12-17 v1

摘要

迄今为止,大多数位置识别方法专注于单模态检索。虽然它们在特定环境中表现良好,但跨模态方法通过允许在地图源和查询源之间无缝切换,提供了更大的灵活性。它还承诺通过拥有一个统一模型来减少计算需求,并通过共享参数实现更高的样本效率。在这项工作中,我们开发了一种通用的位置识别解决方案 UniLoc,它适用于任意单一查询模态(自然语言、图像或点云)。UniLoc 利用了大规模对比学习的最新进展,并通过在两个层级上进行分层匹配来学习:实例级匹配和场景级匹配。具体而言,我们提出了一个新颖的基于自注意力的池化 (SAP) 模块,用于评估实例描述符在聚合为位置级描述符时的重要性。在 KITTI-360 数据集上的实验证明了跨模态对位置识别的益处,在跨模态设置中取得了卓越的性能,并在单模态场景中也取得了具有竞争力的结果。我们的项目页面公开于 https://yan-xia.github.io/projects/UniLoc/。

关键词

引用

@article{arxiv.2412.12079,
  title  = {UniLoc: Towards Universal Place Recognition Using Any Single Modality},
  author = {Yan Xia and Zhendong Li and Yun-Jin Li and Letian Shi and Hu Cao and João F. Henriques and Daniel Cremers},
  journal= {arXiv preprint arXiv:2412.12079},
  year   = {2024}
}

备注

14 pages, 10 figures