全局跨模态地理定位:百万级数据集与物理一致性学习框架
计算机视觉与模式识别
2026-03-10 v1
摘要
跨模态地理定位(CMGL)将 ground-level 文本描述与 geo-tagged 空中图像匹配,这对于行人导航和紧急响应至关重要。然而,现有研究受限于狭小的地理覆盖范围和简单粗糙的场景多样性,无法反映全球建筑风格和地形特征的巨大空间异质性。为填补这一差距并实现 universal positioning,我们引入 CORE,首个专为全球 CMGL 设计的百万级数据集。CORE 包含 1,034,786 组跨视图图像,来自 225 个不同地理区域,覆盖所有大陆,提供在各种环境条件和城市布局下罕见的视角多样性。我们利用大型视觉-语言模型(LVLMs)的 zero-shot reasoning 来合成高质量场景描述,丰富且富含判别线索。此外,我们提出一种物理规律感知网络(PLANET)用于跨模态地理定位。PLANET 引入一种新颖的对比学习范例,引导文本表示捕获卫星图像的内在物理特征。跨越各种地理区域的广泛实验表明,PLANET 在准确性上显著优于 state-of-the-art 方法,建立了鲁棒的全球规模地理定位的新基准。该数据集和源代码将在 https://github.com/YtH0823/CORE 上发布。
引用
@article{arxiv.2603.08491,
title = {Global Cross-Modal Geo-Localization: A Million-Scale Dataset and a Physical Consistency Learning Framework},
author = {Yutong Hu and Jinhui Chen and Chaoqiang Xu and Yuan Kou and Sili Zhou and Shaocheng Yan and Pengcheng Shi and Qingwu Hu and Jiayuan Li},
journal= {arXiv preprint arXiv:2603.08491},
year = {2026}
}