中文

VICI: 视觉语言模型指导的跨视角图像定位

计算机视觉与模式识别 2025-07-23 v2

摘要

在本文中,我们提出了一种针对 UAVM 2025 挑战赛的高性能解决方案,该挑战赛专注于使用 University-1652 数据集,将窄视场(FOV)街景图像与相应的卫星图像进行匹配。随着全景跨视角地理定位接近性能巅峰,探索更实际的问题表述变得越来越重要。现实场景很少提供全景街景查询;相反,查询通常由使用未知相机参数拍摄的有限视场图像组成。我们的工作优先考虑在这些约束下发现可达到的最高性能,并推动现有架构的极限。我们的方法首先为给定查询检索候选卫星图像嵌入,然后进行重排序阶段,该阶段有选择性地提高前几名候选者中的检索精度。这种两阶段方法即使在任务固有的显著视角和尺度变化下也能实现更精确的匹配。通过实验,我们证明了我们的方法取得了有竞争力的结果——具体而言,实现了 R@1 和 R@10 检索率分别为 \topone\% 和 \topten\%。这凸显了优化检索和重排序策略在推进实际地理定位性能方面的潜力。代码可在 https://github.com/tavisshore/VICI 获取。

关键词

引用

@article{arxiv.2507.04107,
  title  = {VICI: VLM-Instructed Cross-view Image-localisation},
  author = {Xiaohan Zhang and Tavis Shore and Chen Chen and Oscar Mendez and Simon Hadfield and Safwan Wshah},
  journal= {arXiv preprint arXiv:2507.04107},
  year   = {2025}
}