中文

DSFormer:用于视觉地点识别的双尺度交叉学习 Transformer

计算机视觉与模式识别 2025-07-25 v1 机器人学

摘要

视觉地点识别(VPR)是维持稳健移动机器人定位的关键任务,却面临在不同环境条件和视角下保持可靠性能的挑战。为此,我们提出一种新框架,将 Dual-Scale-Former(DSFormer)——一种基于 Transformer 的交叉学习模块——与一种创新的块聚类策略相结合。DSFormer 通过使来自最终两层 CNN 特征的双尺度特征之间实现双向信息传递来增强特征表示,通过在每个尺度内的自注意力捕获长程依赖,通过共享的交叉注意力实现跨尺度学习。此外,我们的块聚类策略重新组织了来自多个不同视角的广泛使用的旧金山超大型(SF-XL)训练数据集,优化了数据组织,从而进一步增强对视角变化的鲁棒性。总体而言,这些创新不仅产生一种适用于环境变化的稳健全局嵌入,还将所需的训练数据量约降低 30%,相较于以前的分区方法。全面的实验表明,我们的方法在大多数基准数据集上实现了最先进的性能,超过了诸如 DELG、Patch-NetVLAD、TransVPR 和 R2Former 等高级重排序方法,作为使用 512 维全局描述符的全局检索解决方案,同时显著提高了计算效率。

关键词

引用

@article{arxiv.2507.18444,
  title  = {DSFormer: A Dual-Scale Cross-Learning Transformer for Visual Place Recognition},
  author = {Haiyang Jiang and Songhao Piao and Chao Gao and Lei Yu and Liguo Chen},
  journal= {arXiv preprint arXiv:2507.18444},
  year   = {2025}
}