中文

基于位置增强与多头跨注意力的对象级跨视图地理定位

计算机视觉与模式识别 2025-05-26 v1 人工智能

摘要

跨视图地理定位通过匹配查询图像(由无人机或地面相机捕获)与已标注卫星图像来确定图像位置。虽然传统方法聚焦于图像级定位,但许多应用(如搜救、设施检查和精准配送)需要对象级精度。这使得用户能够通过无人机图像上的单次点击来检索该对象的精确地理标签信息。然而,视角、时机和成像条件的差异在大规模卫星图像中识别视觉相似对象的挑战尤为突出。为此,我们提出对象级跨视图地理定位网络 (Object-level Cross-view Geo-localization Network, OCGNet)。它集成了使用高斯核迁移 (Gaussian Kernel Transfer, GKT) 保留用户指定点击位置的机制,将该线索双向嵌入特征编码器和特征匹配模块,确保对象特定的定位稳健。此外,OCGNet 包含位置增强 (Location Enhancement, LE) 模块和多头跨注意力 (Multi-Head Cross Attention, MHCA) 模块,以在必要时自适应地强调对象特定特征或扩展注意力以覆盖相关上下文区域。OCGNet 在公开数据集 CVOGL 上实现了最先进的性能。它还展示了few-shot 学习能力,有效地从有限的示例中泛化,适用于多种应用场景(https://github.com/ZheyangH/OCGNet)

关键词

引用

@article{arxiv.2505.17911,
  title  = {Object-level Cross-view Geo-localization with Location Enhancement and Multi-Head Cross Attention},
  author = {Zheyang Huang and Jagannath Aryal and Saeid Nahavandi and Xuequan Lu and Chee Peng Lim and Lei Wei and Hailing Zhou},
  journal= {arXiv preprint arXiv:2505.17911},
  year   = {2025}
}