GeoBridge:一个基于语义锚点的多视图基础模型,通过桥接图像和文本实现地理定位
计算机视觉与模式识别
2026-04-16 v3
摘要
跨视图地理定位通过检索与查询图像在视觉上对应的带地理标签的参考图像来推断位置。然而,传统的以卫星为中心的范式在高分辨率或最新的卫星影像不可用时限制了鲁棒性。它进一步低估了跨视图(例如无人机、卫星和街道)和跨模态(例如语言和图像)的互补线索。为了解决这些挑战,我们提出了GeoBridge,一个执行跨视图双向匹配并支持语言到图像检索的新型模型。超越传统的以卫星为中心的公式,GeoBridge建立在一种新的语义锚点机制上,该机制通过文本描述桥接多视图特征,以实现鲁棒、灵活的定位。为了支持这项任务,我们构建了GeoLoc,第一个大规模的、跨模态的和多视图对齐的数据集,包含超过50,000对无人机、街景全景和卫星图像及其文本描述,收集自36个国家,确保了地理和语义对齐。我们在多个任务上进行了广泛评估。实验证实,GeoLoc预训练显著提高了GeoBridge的地理定位精度,同时促进了跨域泛化和跨模态知识迁移。代码、数据集和预训练模型将在https://github.com/MiliLab/GeoBridge发布。
引用
@article{arxiv.2512.02697,
title = {GeoBridge: A Semantic-Anchored Multi-View Foundation Model Bridging Images and Text for Geo-Localization},
author = {Zixuan Song and Jing Zhang and Di Wang and Zidie Zhou and Wenbin Liu and Haonan Guo and En Wang and Bo Du},
journal= {arXiv preprint arXiv:2512.02697},
year = {2026}
}
备注
The paper is accepted by CVPR 2026! Code, dataset, and pretrained models will be released at https://github.com/MiliLab/GeoBridge