中文

用于跨视角地理定位的 Transformer 引导卷积神经网络

计算机视觉与模式识别 2022-04-22 v1

摘要

地面到空中的地理定位是指通过将该地面查询图像与带有地理标签的航空影像参考数据库进行匹配来定位该图像。由于这两种视角在视觉外观和几何构型上存在巨大的透视差异,这非常具有挑战性。在这项工作中,我们提出了一种新颖的 Transformer 引导卷积神经网络(TransGCNN)架构,它将基于 CNN 的局部特征与基于 Transformer 的全局表示相耦合,以增强表示学习。具体而言,我们的 TransGCNN 由一个从输入图像提取特征图的 CNN 主干和一个从 CNN 特征图建模全局上下文的 Transformer 头组成。特别地,我们的 Transformer 头充当空间感知的重要性生成器,以选择显著的 CNN 特征作为最终特征表示。这种耦合过程使我们能够利用轻量级 Transformer 网络极大地增强嵌入特征的判别能力。此外,我们设计了一个双分支 Transformer 头网络,以结合多尺度窗口的图像特征,从而改善全局特征表示的细节。在流行基准数据集上的大量实验表明,我们的模型在 CVUSA 和 CVACT_val 上分别达到了 94.12% 和 84.92% 的 top-1 准确率,以少于 50% 的参数量和几乎 2 倍的更高帧率优于第二好的基线,从而实现了更优的精度-效率权衡。

关键词

引用

@article{arxiv.2204.09967,
  title  = {Transformer-Guided Convolutional Neural Network for Cross-View Geolocalization},
  author = {Teng Wang and Shujuan Fan and Daikun Liu and Changyin Sun},
  journal= {arXiv preprint arXiv:2204.09967},
  year   = {2022}
}