基于迭代渲染的无监督多视角无人机图像地理定位
计算机视觉与模式识别
2024-11-25 v1 机器人学
图像与视频处理
摘要
无人机跨视图地理定位(CVGL)因斜视无人机图像与俯瞰卫星图像之间的视差问题,存在显著挑战。现有方法高度依赖标注数据集的监督,以提取跨视图不变特征进行跨视图检索。然而,这些方法训练成本高昂,容易过拟合区域特定线索,对新区域的泛化性有限。为克服此问题,我们提出一种无监督方案,通过从无人机观测数据将场景表示提升至三维空间,以生成卫星图像,从而提供抗视角失真的稳健表示。通过生成接近卫星视图的正交图像,我们的方法减少了特征表示中的视差,缓解了区域特定图像配对中的捷径。为进一步对齐渲染图像的视角与真实视角,我们设计了迭代相机姿态更新机制,通过逐步调制渲染查询图像以匹配潜在卫星目标,消除相对于参考图像的空间偏移。此外,这一迭代细化策略通过跨迭代的视角一致融合,进一步增强跨视图特征的不变性。因此,我们的无监督范式自然避免了区域特定过拟合的问题,实现无需特征微调或数据驱动训练的通用无人机图像CVGL。在University-1652和SUES-200数据集上实验表明,我们的方法显著提高了地理定位精度,同时在 diverse 区域间保持稳健性。值得注意的是,在无需模型微调或配对训练的情况下,我们的方法能够与最新监督方法保持竞争力。
引用
@article{arxiv.2411.14816,
title = {Unsupervised Multi-view UAV Image Geo-localization via Iterative Rendering},
author = {Haoyuan Li and Chang Xu and Wen Yang and Li Mi and Huai Yu and Haijian Zhang},
journal= {arXiv preprint arXiv:2411.14816},
year = {2024}
}
备注
13 pages