中文

GeoDTR+:通过几何解耦实现通用跨视角地理定位

计算机视觉与模式识别 2024-08-15 v2

摘要

跨视角地理定位(CVGL)通过将地面图像与数据库中带地理标签的航拍图像进行匹配来估计地面图像的位置。近期工作在 CVGL 基准上取得了显著进展。然而,现有方法在跨区域评估中性能仍然较差,其中训练与测试数据来自完全不同的区域。我们将此缺陷归因于缺乏提取视觉特征几何布局的能力以及模型对低级细节的过拟合。我们的初步工作引入了几何布局提取器(GLE)以从输入特征中捕获几何布局。然而,先前的 GLE 并未充分利用输入特征中的信息。在本工作中,我们提出 GeoDTR+,其具有增强的 GLE 模块,能更好地建模视觉特征间的相关性。为充分探索初步工作中的 LS 技术,我们进一步提出对比难样本生成(CHSG)以促进模型训练。大量实验表明,GeoDTR+ 在 CVUSA、CVACT 和 VIGOR 的跨区域评估中以较大优势(无极坐标变换下分别为 16.44%16.44\%22.71%22.71\%13.66%13.66\%)取得了 SOTA 结果,同时保持与现有 SOTA 相当的同区域性能。此外,我们对 GeoDTR+ 提供了详细分析。我们的代码将发布于 https://gitlab.com/vail-uvm/geodtr plus。

关键词

引用

@article{arxiv.2308.09624,
  title  = {GeoDTR+: Toward generic cross-view geolocalization via geometric disentanglement},
  author = {Xiaohan Zhang and Xingyu Li and Waqas Sultani and Chen Chen and Safwan Wshah},
  journal= {arXiv preprint arXiv:2308.09624},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2212.04074