CurriculumLoc:通过多阶段细化增强跨域地理定位
计算机视觉与模式识别
2025-01-14 v1 机器人学
摘要
视觉地理定位是一项经济高效且可扩展的任务,涉及将在一未知地点拍摄的一张或多张查询图像与一组带地理标签的参考图像进行匹配。现有方法致力于语义特征表示,并朝着对查询与参考之间广泛差异(包括光照和视角变化以及尺度和季节性变化)的鲁棒性演进。然而,实用的视觉地理定位方法需要在外观变化和极端视角变化条件下保持鲁棒,同时提供准确的全局位置估计。因此,受课程设计启发——人类先学习通用知识再深入专业知识——我们首先识别语义场景,然后度量几何结构。我们提出的方法称为 CurriculumLoc,其包含精细设计的多阶段细化流程,以及具有全局语义感知和局部几何验证的新型关键点检测与描述。我们基于这些关键点和相应描述符对候选重排序,并求解特定的跨域透视-n-点(PnP)问题,位置细化逐步进行。在我们收集的数据集 TerraTrack 和基准数据集 ALTO 上的大量实验结果表明,我们的方法具备了上述实用视觉地理定位方案所需特性。此外,在 ALTO 上采用两种不同距离度量分别取得了 62.6% 和 94.5% 的召回率@1(recall@1)新高分。数据集、代码和训练模型已公开于 https://github.com/npupilab/CurriculumLoc。
引用
@article{arxiv.2311.11604,
title = {CurriculumLoc: Enhancing Cross-Domain Geolocalization through Multi-Stage Refinement},
author = {Boni Hu and Lin Chen and Runjian Chen and Shuhui Bu and Pengcheng Han and Haowei Li},
journal= {arXiv preprint arXiv:2311.11604},
year = {2025}
}
备注
14 pages, 15 figures