中文

基于Transformer的自适应语义聚合方法用于无人机视觉地理定位

计算机视觉与模式识别 2025-02-20 v1

摘要

本文处理无人机视觉地理定位任务,旨在匹配由不同平台(即无人机和卫星)拍摄的同一地理目标的图像。通常,实现精确的无人机-卫星图像匹配的关键在于提取对视角变化、尺度变化和旋转鲁棒的视觉特征。当前的工作表明,部分匹配对于无人机视觉地理定位至关重要,因为部分级表示可以捕获图像细节并帮助理解场景的语义信息。然而,在部分级表示中保留语义特征的重要性尚未得到充分讨论。在本文中,我们介绍了一种基于Transformer的自适应语义聚合方法,该方法将部分视为图像中最具代表性的语义。图像块与不同部分的相关性根据Transformer的特征图进行学习。然后,我们的方法将部分级特征分解为所有块特征的自适应和。通过这样做,学习到的部分被鼓励关注具有典型语义的块。在University-1652数据集上的大量实验表明,我们的方法优于当前的工作。

关键词

引用

@article{arxiv.2401.01574,
  title  = {A Transformer-Based Adaptive Semantic Aggregation Method for UAV Visual Geo-Localization},
  author = {Shishen Li and Cuiwei Liu and Huaijun Qiu and Zhaokui Li},
  journal= {arXiv preprint arXiv:2401.01574},
  year   = {2025}
}

备注

12 pages