中文

OSMLoc: 基于单张图像的 OpenStreetMap 视觉定位,融合几何与语义引导

计算机视觉与模式识别 2025-09-03 v3

摘要

OpenStreetMap (OSM) 是一种丰富且多功能的志愿地理信息 (VGI) 来源,通过将附近的视觉观测与矢量化地图数据相结合,促进了人类的自我定位和场景理解。然而,模态和视角的差异给有效匹配相机图像与紧凑地图表示带来了主要挑战,从而限制了 VGI 数据在实际定位应用中的全部潜力。受人类大脑依赖几何和语义理解的融合进行空间定位任务这一事实的启发,本文提出了 OSMLoc。OSMLoc 是一种基于第一人称视角图像对抗 OSM 地图的脑启发式视觉定位方法。它集成了语义和几何引导,显著提高了准确性、鲁棒性和泛化能力。首先,我们为 OSMLoc 配备了视觉基础模型以提取强大的图像特征。其次,提出了一种几何引导的深度分布适配器,以弥合单目深度估计与相机到 BEV 变换之间的鸿沟。第三,利用来自 OSM 数据的语义嵌入作为图像到 OSM 特征匹配的辅助引导。为了验证所提出的 OSMLoc,我们收集了一个全球跨区域和跨条件 (CC) 基准以进行广泛评估。在 MGL 数据集、CC 验证基准和 KITTI 数据集上的实验证明了我们方法的优越性。代码、预训练模型、CC 验证基准和更多结果可在以下地址获取:https://github.com/WHU-USI3DV/OSMLoc。

关键词

引用

@article{arxiv.2411.08665,
  title  = {OSMLoc: Single Image-Based Visual Localization in OpenStreetMap with Fused Geometric and Semantic Guidance},
  author = {Youqi Liao and Xieyuanli Chen and Shuhao Kang and Jianping Li and Zhen Dong and Hongchao Fan and Bisheng Yang},
  journal= {arXiv preprint arXiv:2411.08665},
  year   = {2025}
}

备注

18 pages, technical report