中文

DiffusionUavLoc:基于视觉提示的无人机跨视图定位扩散模型

计算机视觉与模式识别 2025-11-11 v1

摘要

随着低空经济的快速发展,无人机(UAV)已成为智能巡检系统中进行测量和跟踪的关键平台。然而,在缺乏卫星信号(GNSS)的环境中,仅依赖卫星信号的定位方案容易出现故障。基于跨视图图像检索的定位方法虽是有前景,但在斜视无人机视图与倾斜卫星正射影像之间存在显著的几何和视觉领域差异。此外,传统方法常依赖复杂的网络结构、文本提示或大量标注,限制了其泛化能力。为解决上述问题,我们提出了 DiffusionUavLoc,这是一个基于图像提示、无文本、以扩散模型为核心并采用变分自编码器(VAE)实现统一表征的跨视图定位框架。我们首先使用训练自由的几何渲染技术,从无人机图像合成伪卫星图像作为结构提示。随后,我们设计了一个无文本的条件扩散模型,将多模态结构线索融合,以学习对视角变化鲁健的特征。在推理阶段, descriptors 在固定时间步 t 计算,并使用余弦相似度进行比较。在 University-1652 和 SUES-200 数据集上,该方法在跨视图定位任务中表现出竞争力,尤其在 University-1652 数据集上的卫星到无人机定位效果尤为突出。我们的数据和代码将发布在以下网址:https://github.com/liutao23/DiffusionUavLoc.git。

关键词

引用

@article{arxiv.2511.06422,
  title  = {DiffusionUavLoc: Visually Prompted Diffusion for Cross-View UAV Localization},
  author = {Tao Liu and Kan Ren and Qian Chen},
  journal= {arXiv preprint arXiv:2511.06422},
  year   = {2025}
}