基于演化 Transformer 的跨视角地理定位
计算机视觉与模式识别
2021-07-06 v2
摘要
本文研究跨视角地理定位问题,即通过将与地理标记航拍图像数据库匹配来估计街景图像的地理空间位置。由于不同视角间外观与几何差异巨大,跨视角匹配任务极具挑战性。与现有主要依赖 CNN 的方法不同,我们设计了一种新颖的演化地理定位 Transformer (EgoTR),它利用 Transformer 中自注意力的特性来建模全局依赖关系,从而显著减少跨视角地理定位中的视觉歧义。我们还利用 Transformer 的位置编码来帮助 EgoTR 理解并对应地面与航拍图像之间的几何配置。与对几何知识施加强假设的最先进方法相比,EgoTR 通过训练目标灵活地学习位置嵌入,因此在许多真实场景中也更实用。尽管 Transformer 非常契合我们的任务,但其原始自注意力机制在各层内独立地与图像块交互,忽略了层间关联。为此,本文提出一种简单而有效的自交叉注意力机制以提升所学表征的质量。自交叉注意力建模相邻层间的全局依赖,既关联图像块又刻画特征在前一层的演化方式。结果表明,所提自交叉注意力带来了更稳定的训练,提升了泛化能力,并促使表征随网络加深持续演化。大量实验表明,我们的 EgoTR 在标准、细粒度及跨数据集的跨视角地理定位任务上均优于最先进方法。
引用
@article{arxiv.2107.00842,
title = {Cross-view Geo-localization with Evolving Transformer},
author = {Hongji Yang and Xiufan Lu and Yingying Zhu},
journal= {arXiv preprint arXiv:2107.00842},
year = {2021}
}
备注
Under Review