中文

CLNet:跨视图对应关系赋力地理定位

计算机视觉与模式识别 2025-12-17 v1 人工智能

摘要

图像检索驱动的跨视图地理定位(IRCVGL)旨在匹配显著不同视角捕获的图像,如卫星和街景图像。现有方法主要依赖学习鲁棒的全局表示或隐式特征对齐,往往难以建模对准精确定位至关重要的显式空间对应关系。本文提出一种新颖的对应感知特征细化框架,称为CLNet,显式地桥接了不同视图之间的语义和几何鸿沟。CLNet将视图对齐过程分解为三个可学习且互补的模块:一个神经对应图(NCM),通过潜在对应场实现跨视图特征的空间对齐;一个非线性嵌入转换器(NEC),使用基于MLP的转换实现特征跨视角重映射;以及一个全局特征重校准(GFR)模块,利用所学空间线索对信息性特征通道进行重新加权。该方法能够联合捕获高层语义和细粒度对齐。广泛的实验在四个公开基准数据集上进行,包括CVUSA、CVACT、VIGOR和University-1652,结果表明,我们提出的CLNet实现了最先进的性能,同时提供了更好的可解释性和可泛化性。

关键词

引用

@article{arxiv.2512.14560,
  title  = {CLNet: Cross-View Correspondence Makes a Stronger Geo-Localizationer},
  author = {Xianwei Cao and Dou Quan and Shuang Wang and Ning Huyan and Wei Wang and Yunan Li and Licheng Jiao},
  journal= {arXiv preprint arXiv:2512.14560},
  year   = {2025}
}

备注

16 pages, 6 figures