中文

CV-Cities:推进全球城市的跨视角地理定位

计算机视觉与模式识别 2024-11-20 v1

摘要

跨视角地理定位(CVGL)涉及匹配和检索卫星图像以确定地面图像的地理位置,这在受 GNSS 限制的场景中至关重要。然而,由于显著的视角差异、定位场景的复杂性以及全球定位的需求,该任务面临重大挑战。为了解决这些问题,我们提出了一种新颖的 CVGL 框架,该框架将视觉基础模型 DINOv2 与先进的特征混合器相结合。我们的框架引入了对称 InfoNCE 损失,并结合了近邻采样和动态相似度采样策略,显著提高了定位精度。实验结果表明,我们的框架在多个公开数据集和自建数据集上均超越了现有方法。为了进一步提高全球尺度的性能,我们开发了 CV-Cities,一个用于全球 CVGL 的新颖数据集。CV-Cities 包含 223,736 对带有地理定位数据的地面-卫星图像对,跨越六大洲的 16 个城市,涵盖广泛的复杂场景,为 CVGL 提供了具有挑战性的基准。使用 CV-Cities 训练的框架在各个测试城市中表现出较高的定位精度,凸显了其强大的全球化能力和泛化能力。我们的数据集和代码可在 https://github.com/GaoShuang98/CVCities 获取。

关键词

引用

@article{arxiv.2411.12431,
  title  = {CV-Cities: Advancing Cross-View Geo-Localization in Global Cities},
  author = {Gaoshuang Huang and Yang Zhou and Luying Zhao and Wenjian Gan},
  journal= {arXiv preprint arXiv:2411.12431},
  year   = {2024}
}

备注

Datasets and codes are available, accepted by IEEE JSTARS