跨视图图像集地理定位
计算机视觉与模式识别
2024-12-30 v1
摘要
跨视图地理定位(Cross-view geo-localization, CVGL)已在机器人导航和增强现实等领域得到广泛应用。现有方法主要使用单张图像或固定视角图像序列作为查询对象,这限制了视角的多样性。相反,当人类确定自身位置时,通常会围绕运动以gather多种视角。这种行为表明,整合多样化的视觉线索可以提高地理定位的可靠性。因此,我们提出了一种新任务:跨视图图像集地理定位(Set-CVGL),将包含多种视角的多个图像作为查询集用于定位。为支持这一任务,我们引入SetVL-480K基准数据集,包含48万张全球地面图像及其对应的卫星图像,其中每个卫星图像平均对应40张来自不同视角和位置的地面图像。此外,我们提出了一种灵活的方法FlexGeo,专为Set-CVGL设计,同时也可适应单张图像和图像序列输入。FlexGeo包括两个关键模块:相似度引导特征融合器(Similarity-guided Feature Fuser, SFF),用于在无需内容依赖先验条件下自适应融合图像特征;以及基于Individual-level Attributes Learner(IAL),利用每张图像的地理属性进行全面场景感知。FlexGeo在SetVL-480K以及两个公开数据集SeqGeo和KITTI-CVL上 consistently outperform现有方法,在SetVL-480K上的定位精度提升超过22%。
引用
@article{arxiv.2412.18852,
title = {Cross-View Image Set Geo-Localization},
author = {Qiong Wu and Panwang Xia and Lei Yu and Yi Liu and Mingtao Xiong and Liheng Zhong and Jingdong Chen and Ming Yang and Yongjun Zhang and Yi Wan},
journal= {arXiv preprint arXiv:2412.18852},
year = {2024}
}