中文

面向汽车地理定位的共视觉模式增强生成式 Transformer 学习

计算机视觉与模式识别 2023-04-21 v2

摘要

地理定位是无人车路径规划与导航的基本组成部分,但基于 GNSS 的地理定位在拒绝服务条件下会失效。跨视角地理定位(CVGL)旨在通过匹配海量带地理标签的航空(如卫星)图像来估计地面级相机的地理位置,已受到广泛关注,但由于航空-地面视角间剧烈的外观差异,仍极具挑战性。在现有方法中,不同视角的全局表示主要使用类孪生架构提取,但其交互增益很少被考虑。本文提出一种将跨视角知识生成技术与 transformers 结合的新方法,即互生成 Transformer 学习(MGTL),用于 CVGL。具体而言,利用骨干网络生成的初始表示,MGTL 构建两个独立的生成式子模块——一个从地面视角语义生成航空感知知识,反之亦然——并通过注意力机制充分挖掘完全互利的收益。此外,为更好地捕捉航空与地面视角间的共视觉关系,我们引入级联注意力掩码算法以进一步提升精度。在具挑战性的公开基准 CVACT 和 CVUSA 上的大量实验证明了所提方法的有效性,其相比现有 SOTA 模型刷新了纪录。

关键词

引用

@article{arxiv.2203.09135,
  title  = {Co-visual pattern augmented generative transformer learning for automobile geo-localization},
  author = {Jianwei Zhao and Qiang Zhai and Pengbo Zhao and Rui Huang and Hong Cheng},
  journal= {arXiv preprint arXiv:2203.09135},
  year   = {2023}
}

备注

21pages