中文

Just Zoom In:基于自回归缩放的跨视图地理定位

计算机视觉与模式识别 2026-03-27 v1 人工智能

摘要

跨视图地理定位 (CVGL) 通过匹配街道视图图像与地理参考卫星影像来估计摄像机位置,实现 GPS 禁用时的定位和导航。现有方法几乎全部将 CVGL 表述为在对比学习嵌入空间中的图像检索问题。这将性能绑定于大批量和硬性负难挖掘,同时忽略了地图的几何结构以及街景图像与卫星影像之间的覆盖不匹配。特别是,街景可见的显著地标可能位于固定卫星裁剪区域之外,导致检索目标模糊,限制了对地图上显式空间推理。我们提出 Just Zoom In,一种通过卫星地图上的自回归缩放来实现 CVGL 的替代方法。从粗糙卫星视图开始,模型依据一系列缩放决策,选取目标分辨率下的终端卫星单元,而无需对比损失或硬性负难挖掘。我们进一步引入了一个真实可行的基准,包含众所争议的街景图像和高分辨率卫星影像,反映真实捕获条件。在此基准上,Just Zoom In 实现了最先进的性能,使 Recall@1 在 50 米内提升 5.5%,在 100 米内提升 9.6%,显著超过最强的对比检索基线。这些结果表明,顺序的粗到细空间推理对于跨视图地理定位具有有效性。

关键词

引用

@article{arxiv.2603.25686,
  title  = {Just Zoom In: Cross-View Geo-Localization via Autoregressive Zooming},
  author = {Yunus Talha Erzurumlu and Jiyong Kwag and Alper Yilmaz},
  journal= {arXiv preprint arXiv:2603.25686},
  year   = {2026}
}

备注

18 pages, 6 figures