GLEAM:学习在跨视角地理定位中进行匹配与解释
计算机视觉与模式识别
2026-02-03 v3 计算与语言
摘要
跨视角地理定位(CVGL)专注于识别从同一地理位置的不同视角捕获的图像之间的对应关系。然而,现有的 CVGL 方法通常局限于单一视角或模态,且其直接的视觉匹配策略缺乏可解释性:它们仅判断两幅图像是否对应,而不解释匹配背后的原因。在本文中,我们提出了 GLEAM-C,这是一个基础 CVGL 模型,通过将多视角和多模态数据仅与卫星图像对齐来统一它们。我们的框架通过优化实现提高了训练效率,并通过一种新颖的两阶段训练策略达到了与先前特定模态 CVGL 模型相当的准确率。为了解决可解释性问题,我们进一步提出了 GLEAM-X,这是一个新颖的任务,它将跨视角对应预测与由多模态大语言模型(MLLMs)实现的可解释推理相结合。我们使用商业 MLLMs 构建了一个双语基准,以生成训练和测试数据,并通过严格的人工修订来完善测试集,以系统评估可解释的跨视角推理。GLEAM-C 和 GLEAM-X 共同构成了一个全面的 CVGL 流程,该流程集成了多模态、多视角对齐与可解释的对应分析,统一了精确的跨视角匹配与可解释推理,并通过使模型能够更好地解释与匹配(Explain And Match)来推动地理定位的发展。本工作使用的代码和数据集将在 https://github.com/Lucky-Lance/GLEAM 上公开。
引用
@article{arxiv.2509.07450,
title = {GLEAM: Learning to Match and Explain in Cross-View Geo-Localization},
author = {Xudong Lu and Zhi Zheng and Yi Wan and Yongxiang Yao and Annan Wang and Renrui Zhang and Panwang Xia and Qiong Wu and Qingyun Li and Weifeng Lin and Xiangyu Zhao and Peifeng Ma and Xue Yang and Hongsheng Li},
journal= {arXiv preprint arXiv:2509.07450},
year = {2026}
}
备注
23 pages