中文

跨视图时序图像定位中的时间注意力机制

计算机视觉与模式识别 2024-08-29 v1

摘要

本文提出了一种新颖的方法,用于增强跨视图定位,聚焦于在单个已知卫星图像块内对街景图像进行细粒度、时序图像定位,这与传统的单点到单点的图像检索方法有显著区别。通过扩展到时序图像的细粒度定位,我们的模型配备了新颖的时间注意力模块 (TAM),利用上下文信息显著提高时序图像定位精度。在 CVIS 数据集上,我们的方法在均值和中位数定位误差上均实现了显著降低,超越了当前最先进的单图像定位技术。此外,通过将 KITTI-CVL 数据集适应为时序图像集,我们不仅为未来研究提供了更真实的数据集,也证明了我们模型在不同时间和区域上的稳健泛化能力,跨视图时序图像定位的平均距离误差降低了 75.3%。

关键词

引用

@article{arxiv.2408.15569,
  title  = {Temporal Attention for Cross-View Sequential Image Localization},
  author = {Dong Yuan and Frederic Maire and Feras Dayoub},
  journal= {arXiv preprint arXiv:2408.15569},
  year   = {2024}
}

备注

Accepted to IROS 2024