用于跨视角地理定位的带 KV 路由的可学习查询聚合
计算机视觉与模式识别
2026-01-01 v1
摘要
跨视角地理定位(CVGL)旨在通过将查询图像与大规模数据库中的图像进行匹配来估计其地理位置。然而,显著的视角差异对有效的特征聚合与对齐提出了相当大的挑战。为了应对这些挑战,我们提出了一种包含三个关键改进的新型 CVGL 系统。首先,我们利用 DINOv2 主干并结合卷积适配器微调,以增强模型对跨视角变化的适应性。其次,我们提出了一个多尺度通道重分配模块,以增强空间表示的多样性和稳定性。最后,我们提出了一个改进的聚合模块,将混合专家路由集成到特征聚合过程中。具体而言,该模块在交叉注意力框架中为键和值动态选择专家子空间,从而实现对异构输入域的自适应处理。在 University-1652 和 SUES-200 数据集上的大量实验表明,我们的方法在训练参数更少的情况下实现了具有竞争力的性能。
引用
@article{arxiv.2512.23938,
title = {Learnable Query Aggregation with KV Routing for Cross-view Geo-localisation},
author = {Hualin Ye and Bingxi Liu and Jixiang Du and Yu Qin and Ziyi Chen and Hong Zhang},
journal= {arXiv preprint arXiv:2512.23938},
year = {2026}
}
备注
7 pages, 4 figures