中文

$R^{2}$Former:用于位置识别的统一检索与重排序 Transformer

计算机视觉与模式识别 2023-04-10 v1

摘要

视觉位置识别(VPR)通过将查询图像与参考数据库中的图像进行匹配来估计其位置。传统方法通常采用聚合的 CNN 特征进行全局检索,并使用基于 RANSAC 的几何验证进行重排序。然而,RANSAC 仅利用了几何信息,而忽略了其他可能对重排序有用的信息,例如局部特征相关性和注意力值。在本文中,我们提出了一个统一的视觉位置识别框架,该框架使用一种名为 R2R^{2}Former 的新型 transformer 模型同时处理检索和重排序。所提出的重排序模块将特征相关性、注意力值和 xy 坐标纳入考虑,并学习判定图像对是否来自同一位置。整个流程是端到端可训练的,且单独的重排序模块也可作为通用组件应用于其他 CNN 或 transformer 主干网络。值得注意的是,R2R^{2}Former 在主要 VPR 数据集上以更少的推理时间和内存消耗显著优于 SOTA 方法。它还在留出的 MSLS 挑战集上达到了 SOTA,可作为现实世界大规模应用的一种简单而强大的解决方案。实验还表明,视觉 transformer token 在局部匹配上与 CNN 局部特征相当,有时甚至更优。代码发布于 https://github.com/Jeff-Zilence/R2Former。

关键词

引用

@article{arxiv.2304.03410,
  title  = {$R^{2}$Former: Unified $R$etrieval and $R$eranking Transformer for Place Recognition},
  author = {Sijie Zhu and Linjie Yang and Chen Chen and Mubarak Shah and Xiaohui Shen and Heng Wang},
  journal= {arXiv preprint arXiv:2304.03410},
  year   = {2023}
}

备注

CVPR