无真值的跨视角视觉地理定位学习
计算机视觉与模式识别
2024-03-20 v1
摘要
跨视角地理定位 (Cross-View Geo-Localization, CVGL) 通过将查询图像与对应的带有 GPS 标签的参考图像进行匹配来确定其地理位置。当前最先进的方法主要依赖于使用带标签的配对图像训练模型,这带来了大量的标注成本和训练负担。在本研究中,我们研究了在无需真值配对标签的情况下将冻结模型适配于 CVGL。我们观察到,在无标签的跨视角图像上进行训练带来了重大挑战,包括需要在无标签数据中建立关系,以及调和不确定查询与参考之间的视角差异。为了应对这些挑战,我们提出了一种自监督学习框架,用于为冻结的基础模型 (Foundation Model, FM) 训练一个可学习的适配器。该适配器旨在仅使用无标签数据将来自不同视角的特征分布映射到统一空间中。为了在无标签数据中建立关系,我们引入了一个基于期望最大化的伪标签模块,该模块迭代地估计跨视角特征之间的关联并优化适配器。为了保持 FM 表示的鲁棒性,我们引入了带有重构损失的信息一致性模块,确保适配后的特征在跨视角时保持强大的判别能力。实验结果表明,我们提出的方法相比原始 FM 取得了显著改进,并且与监督方法相比达到了具有竞争力的准确率,同时需要更少的训练参数并仅依赖无标签数据。对我们针对特定任务模型的适配的评估进一步突显了其广泛的适用性。
引用
@article{arxiv.2403.12702,
title = {Learning Cross-view Visual Geo-localization without Ground Truth},
author = {Haoyuan Li and Chang Xu and Wen Yang and Huai Yu and Gui-Song Xia},
journal= {arXiv preprint arXiv:2403.12702},
year = {2024}
}