中文

跨视图地理定位、图像检索、多尺度几何建模、频域增强

计算机视觉与模式识别 2026-03-04 v1

摘要

跨视图地理定位(CVGL)旨在建立来自显著不同视角的图像之间的空间对应关系,是GNSS受限环境中视觉定位的基本技术。然而,CVGL因严重的几何不对称性、成像域之间纹理不一致以及局部信息的逐渐退化而面临挑战。现有方法主要依赖空间域特征对齐,这种方法对大规模视角变化和局部干扰天然敏感。为缓解这些限制,本文提出了空间和频域增强网络(SFDE),该网络利用空间域和频域的互补表示。SFDE采用三分支并行架构分别建模全局语义上下文、局部几何结构和频域统计稳定性,从而从场景拓扑、多尺度结构模式和频率不变性三个角度刻画跨域一致性。通过渐进式增强和耦合约束,在统一的嵌入空间中联合优化这些互补特征,使模型能够学习到跨多个粒度尺度上的一致性跨视图表示。综合实验表明,SFDE在性能上与当前方法相当,甚至在许多情况下超过最先进的方法,同时保持轻量级和高效计算设计。{我们的代码可在 https://github.com/Mashuaishuai669/SFDE 获取}

关键词

引用

@article{arxiv.2603.02726,
  title  = {Cross-view geo-localization, Image retrieval, Multiscale geometric modeling, Frequency domain enhancement},
  author = {Hongying Zhang and ShuaiShuai Ma},
  journal= {arXiv preprint arXiv:2603.02726},
  year   = {2026}
}