中文

VFM-Loc:通过对判别性视觉层级对齐实现跨视图零样本地理局部化

计算机视觉与模式识别 2026-03-17 v1

摘要

跨视图地理局部化(CVGL)旨在通过匹配 drone-view 查询到带有地理标签的卫星图像来定位无人机视角查询。尽管监督方法在闭合基准测试上取得了强烈结果,但由于严重的视角差异和数据集偏差,往往难以在不受约束的真实场景中泛化。为克服这些限制,我们present了 VFM-Loc,一个用于零样本 CVGL 的 training-free 框架,利用视觉基础模型(VFMs)的通用视觉表示。VFM-Loc 通过渐进式对齐策略识别并匹配不同视角之间的判别性视觉线索。首先,我们设计了基于 Generalized Mean 池化和 Scale-Weighted RMAC 的层次化线索提取机制,以保持跨尺度的独特视觉线索并维持层次化置信度。其次,我们引入基于 domain-wise PCA 和 Orthogonal Procrustes 分析的统计流形对齐管线,在共享度量空间中线性对齐异构特征分布。实验表明,VFM-Loc 在标准基准测试上表现出强大的零样本准确率,并在具有大倾斜角度的具有挑战性的 LO-UCV 数据集上超越监督方法超过 20% 的 Recall@1。该工作凸显了对预训练特征进行原则化对齐可有效弥合跨视图差距,建立了一种稳健且无需训练的真实世界 CVGL 范式。相关代码已公开:https://github.com/DingLei14/VFM-Loc。

关键词

引用

@article{arxiv.2603.13855,
  title  = {VFM-Loc: Zero-Shot Cross-View Geo-Localization via Aligning Discriminative Visual Hierarchies},
  author = {Jun Lu and Zehao Sang and Haoqi Wei and Xiangyun Liu and Kun Zhu and Haitao Guo and Zhihui Gong and Lei Ding},
  journal= {arXiv preprint arXiv:2603.13855},
  year   = {2026}
}