基于内容-视角解�合的鲁棒无人机视角地理定位
计算机视觉与模式识别
2025-11-18 v2
摘要
无人机视角地理定位(Drone-view geo-localization, DVGL)旨在匹配来自无人机和卫星视角的同一地理位置图像。尽管近期进展取得显著成果,但DVGL仍然面临由于视角变化导致的显著外观变化和空间畸变的挑战。现有方法通常假设无人机和卫星图像可通过对比学习直接在共享特征空间中对齐。然而,这一假设忽略了由视角差异引起的固有冲突,导致提取的特征包含不一致的信息,阻碍精准定位。本研究从流形学习视角出发,将交叉视角图像的特征空间建模为由内容和视角共同控制的复合流形。基于此洞见,我们提出了CVD框架,显式解缔内容和视角因子。为促进有效解缔,我们引入两个约束:(i) 视内独立约束,通过最小化它们的互信息来鼓励两个因子之间的统计独立性;(ii) 跨视角重构约束,通过交叉组合来自配对图像的内容和视角来重构每个视角,确保因子特定语义得以保留。作为一个即插即用的模块,CVD无缝集成到现有的DVGL管道中,并降低了推理延迟。在University-1652和SUES-200上的大量实验表明,CVD在各种场景、视角和高度上均表现出强大的鲁棒性和泛化能力,进一步在CVUSA和CVACT上的评估确认了一致的改进。
引用
@article{arxiv.2505.11822,
title = {Robust Drone-View Geo-Localization via Content-Viewpoint Disentanglement},
author = {Ke Li and Di Wang and Xiaowei Wang and Zhihong Wu and Yiming Zhang and Yifeng Wang and Quan Wang},
journal= {arXiv preprint arXiv:2505.11822},
year = {2025}
}