中文

无卫星训练的无人机视角地理定位

计算机视觉与模式识别 2026-04-06 v2

摘要

无人机视角地理定位 (Drone-view geo-localization, DVGL) 旨在确定无人机在 GPS 信号受阻环境下的位置,通过检索给定地理标记卫星图块来获取对应的参考画廊中与之对应的图块。在许多现有表述中,这些观察被表示为单张倾斜无人机图像。相反,本文的卫星自由设置是为多视角无人机序列而设计,这些序列用于在跨视图检索前构建几何归一化的无人机侧位置表示。现有方法在训练时依赖卫星图像,无论是通过配对监督还是无监督对齐,均限制了在卫星数据不可用或受限时的实际部署。本文提出一种无卫星训练 (satellite-free training, SFT) 框架,将无人机图像转换为跨视图兼容表示,经历三个主要阶段:无人机侧 3D 场景重建、几何基于的仿射正投影生成以及用于检索的无卫星特征聚合。具体而言,我们首先使用 3D 高斯溅射方法从多视角无人机图像中重建稠密 3D 场景,并通过 PCA 指导的正射投影将重建的几何投影到仿射正投影上。这一渲染阶段直接在重建的场景几何上操作,无需在渲染时使用相机参数。随后,我们利用轻量级几何引导的图像填充对这些正投影进行细化,以获得纹理完整的无人机侧视图。最后,我们从生成的正投影中提取 DINOv3 补丁特征,仅使用无人机数据学习 Fisher 向量聚合模型,并在测试时重用它对编码的卫星图块进行跨视图检索。在 University-1652 和 SUES-200 上的实验结果表明,SFT 框架在无卫星泛化基线上显著优于传统方法,并缩小了使用卫星图像训练的方法之间的差距。

关键词

引用

@article{arxiv.2604.01581,
  title  = {Satellite-Free Training for Drone-View Geo-Localization},
  author = {Tao Liu and Yingzhi Zhang and Kan Ren and Xiaoqi Zhao},
  journal= {arXiv preprint arXiv:2604.01581},
  year   = {2026}
}