中文

基于解耦几何布局对应的跨视角地理定位

计算机视觉与模式识别 2023-06-19 v3

摘要

跨视角地理定位旨在通过将该查询地面图像与带地理标签的航空图像参考数据库进行匹配来估计其位置。作为一项极具挑战性的任务,其困难源于两个视角之间剧烈的视角变化与不同的拍摄时间。尽管存在这些困难,近期工作在跨视角地理定位基准上取得了显著进展。然而,现有方法在跨区域基准上仍表现不佳,其中训练与测试数据来自两个不同区域。我们将此缺陷归因于缺乏提取视觉特征布局空间配置的能力,以及模型对训练集中低级细节的过拟合。本文中,我们提出GeoDTR,其通过新颖的几何布局提取器模块显式地从原始特征中解耦几何信息,并学习航空与地面图像对之间视觉特征的空间关联。该模块生成一组几何布局描述子,调制原始特征并产生高质量潜表示。此外,我们设计了两类数据增强:(i)布局模拟,在保持低级细节不变的情况下改变空间配置;(ii)语义增强,改变低级细节并促使模型捕获空间配置。这些增强有助于提升跨视角地理定位模型的性能,尤其在跨区域基准上。此外,我们提出基于反事实的学习过程,以助益几何布局提取器探索空间信息。大量实验表明,GeoDTR不仅取得了最先进(SOTA)结果,还显著提升了在同区域与跨区域基准上的性能。

关键词

引用

@article{arxiv.2212.04074,
  title  = {Cross-view Geo-localization via Learning Disentangled Geometric Layout Correspondence},
  author = {Xiaohan Zhang and Xingyu Li and Waqas Sultani and Yi Zhou and Safwan Wshah},
  journal= {arXiv preprint arXiv:2212.04074},
  year   = {2023}
}