GeoDistill:基于几何引导的弱监督自蒸馏用于跨视图定位
计算机视觉与模式识别
2025-07-16 v1
摘要
跨视图定位是通过对齐地面级图像与卫星图像来估计摄像机3自由度(3-DoF)姿态的任务,这对于自动导航和增强现实等大规模户外应用至关重要。现有方法常依赖完全监督学习,需昂贵的姿态标注。本文提出 GeoDistill,一种几何引导的弱监督自蒸馏框架,采用基于视野(Field-of-View, FoV)的掩码进行教师-学生学习,以增强局部特征学习,实现稳健的跨视图定位。在GeoDistill中,教师模型定位全景图像,而学生模型从受限FoV对应的图像中预测位置。通过对齐学生的预测与教师的输出,学生聚焦于关键特征如车道线,忽略纹理稀疏区域如道路。这导致预测更准确,uncertainty降低,无论查询图像是全景图还是受限FoV图。我们的实验表明,GeoDistill 在不同框架下显著提升定位性能。此外,我们引入新型姿态估计网络,无需精确的平面位置标注即可预测相对姿态。GeoDistill 提供了一个可扩展且高效的跨视图定位解决方案。代码与模型可在 https://github.com/tongshw/GeoDistill 查看。
引用
@article{arxiv.2507.10935,
title = {GeoDistill: Geometry-Guided Self-Distillation for Weakly Supervised Cross-View Localization},
author = {Shaowen Tong and Zimin Xia and Alexandre Alahi and Xuming He and Yujiao Shi},
journal= {arXiv preprint arXiv:2507.10935},
year = {2025}
}
备注
accepted by ICCV2025