基于语义对齐的 OpenStreetMap 单目粗到细重定位
计算机视觉与模式识别
2026-03-03 v1
摘要
单目重定位在实现类人感知方面发挥着关键作用。然而,传统方法依赖稠密地图,存在可扩展性限制和隐私风险。作为一种保护隐私的轻量级地图,OpenStreetMap(OSM)提供了具有全球可扩展性的语义和几何信息。然而,使用 OSM 进行定位仍面临挑战:自然图像与 OSM 之间固有的跨模态差异,以及基于全局地图的定位的高计算成本。本文提出一种基于语义对齐的分层搜索框架,用于 OSM 中的定位。首先,利用 DINO-ViT 的语义感知能力将视觉元素分解,以建立与 OSM 的语义关系。其次,设计粗到细搜索范式以取代全局稠密匹配,实现高效的渐进式细化。大量实验表明,我们的方法显著提高了定位精度和速度。虽然仅在单个数据集上训练,我们的方法在 3° 方向召回率上甚至超过了当前方法在 5° 召回率的表现。
引用
@article{arxiv.2603.01613,
title = {Coarse-to-Fine Monocular Re-Localization in OpenStreetMap via Semantic Alignment},
author = {Yuchen Zou and Xiao Hu and Dexing Zhong and Yuqing Tang},
journal= {arXiv preprint arXiv:2603.01613},
year = {2026}
}
备注
7 pages, 4 figures