SkyLink:大型视觉语言模型驱动的无人机跨视角地理定位重排序框架
计算机视觉与模式识别
2026-05-18 v3
摘要
跨视角无人机地理定位根本上是一个具有挑战性的大规模图像检索任务,旨在通过将其匹配 Against 一个广泛标记的卫星图像数据库来确定无人机 (UAV) 查询的地理坐标。大多数现有方法为每个视角学习独立的特征表示,并使用粗糙的启发式方法来评估特征相似性,从而忽略了建模关键跨视角关系的需求。本文提出 SkyLink,一个新颖的即插即用排序框架,首次对视觉间关系进行联合建模,以增强跨视角无人机地理定位。SkyLink 利用大型视觉语言模型 (LVLM) 来建模 UAV 与卫星视觉之间复杂的视觉-语义关系,促进有效的跨视角匹配。为进一步细化学习过程,我们引入了感知关系损失。它利用软标签提供更细致的监督信号,减轻了对近正样本的严厉惩罚。该方法提高了训练稳定性和模型的判别能力。在多个基本检索架构和基准数据集上进行的广泛实验表明,SkyLink 在显著提升现有模型的排序效果方面取得显著成果,在各种具有挑战性的情景中始终实现卓越的性能。
引用
@article{arxiv.2603.08063,
title = {SkyLink: A Large Vision-Language Model Driven Re-ranking Framework for Cross-View UAV geolocalization},
author = {Bowen Liu and Pengyue Jia and Wanyu Wang and Derong Xu and Jiawei Cheng and Jiancheng Dong and Xiao Han and Zimo Zhao and Chao Zhang and Bowen Yu and Fangyu Hong and Xiangyu Zhao},
journal= {arXiv preprint arXiv:2603.08063},
year = {2026}
}