中文

UniPR-3D: Towards Universal Visual Place Recognition with Visual Geometry Grounded Transformer

计算机视觉与模式识别 2025-12-30 v2

摘要

视觉位置识别(VPR)传统上被表述为单图像检索任务。使用多视图具有明显优势,但这一设置仍然相对未被充分探索,且现有方法通常难以泛化到多样化的环境中。在这项工作中,我们引入了 UniPR-3D,这是第一个有效整合多视图信息的 VPR 架构。UniPR-3D 构建在一个能够编码多视图 3D 表示的 VGGT 骨干网络上,我们通过设计特征聚合器并针对位置识别任务进行微调来适配它。为了构建我们的描述符,我们联合利用了 VGGT 产生的 3D 令牌和中间 2D 令牌。基于它们不同的特性,我们为 2D 和 3D 特征设计了专用的聚合模块,使我们的描述符能够捕获细粒度的纹理线索,同时也能跨视角进行推理。为了进一步增强泛化能力,我们结合了单帧和多帧聚合方案,以及一种可变长度序列检索策略。我们的实验表明,UniPR-3D 设立了新的最先进水平,优于单视图和多视图基线,并突显了基于几何的令牌对于 VPR 的有效性。我们的代码和模型将在 Github https://github.com/dtc111111/UniPR-3D 上公开。

关键词

引用

@article{arxiv.2512.21078,
  title  = {UniPR-3D: Towards Universal Visual Place Recognition with Visual Geometry Grounded Transformer},
  author = {Tianchen Deng and Xun Chen and Ziming Li and Hongming Shen and Danwei Wang and Javier Civera and Hesheng Wang},
  journal= {arXiv preprint arXiv:2512.21078},
  year   = {2025}
}