中文

EDTformer:用于视觉地点识别的高效解码 Transformer

计算机视觉与模式识别 2025-05-27 v2

摘要

视觉地点识别(VPR)旨在通过检索大型带地理标签的数据库中与查询图像视觉上相似的图像来确定查询图像的大致地理位置。为了获得每张 place 图像的全局表示,大多数方法通常专注于通过使用当前流行的架构(如 CNN、MLP、池化层和 Transformer 编码器)对从 backbone 提取的深层特征进行聚合,几乎不关注 Transformer 解码器。然而,我们认为其强大的上下文依赖捕获能力和生成精确特征的能力在 VPR 任务中具有相当大的潜力。为此,我们提出了一种用于特征聚合的高效解码 Transformer(EDTformer),其由几个堆叠的简化解码器块组成,后接两个线性层直接产生稳健且判别性强的全局表示。具体而言,我们将深层特征作为 key 和 value,同时将一组可学习的参数作为 query。我们的 EDTformer 能够充分利用深层特征中的上下文信息,然后逐步解码和聚合有效特征以输出全局表示。此外,为了为 EDTformer 提供更强大的深层特征并进一步促进其鲁棒性,我们使用基础模型 DINOv2 作为 backbone,并提出一种低秩并行适应(LoPA)方法来增强其在 VPR 任务中的性能,该方法能够以内存和参数高效的方式逐步细化 backbone 的中间特征。结果表明,我们的方法不仅在多个基准数据集上优于单阶段 VPR 方法,而且在添加相当大成本的再排序后,还优于两种阶段 VPR 方法。代码将在 https://github.com/Tong-Jin01/EDTformer 上提供。

关键词

引用

@article{arxiv.2412.00784,
  title  = {EDTformer: An Efficient Decoder Transformer for Visual Place Recognition},
  author = {Tong Jin and Feng Lu and Shuyu Hu and Chun Yuan and Yunpeng Liu},
  journal= {arXiv preprint arXiv:2412.00784},
  year   = {2025}
}

备注

Accepted by T-CSVT2025