中文

PanoVPR:基于全景视图滑动窗口的统一透视到等距柱状图视觉地点识别

计算机视觉与模式识别 2023-07-31 v2 机器人学 图像与视频处理

摘要

视觉地点识别近年来作为自动驾驶和机器人技术中的一项关键技术受到了显著关注。目前,两种主要方法是透视视图检索(P2P)范式和等距柱状图图像检索(E2E)范式。然而,假设用户仅拥有消费级针孔相机来获取查询透视图像,并在地图提供商的全景数据库图像中检索它们,是实际且自然的。为此,我们提出了 PanoVPR,一种透视到等距柱状图(P2E)视觉地点识别框架,该框架采用滑动窗口以消除由硬裁剪引起的特征截断。具体而言,PanoVPR 在整个等距柱状图上滑动窗口并为每个窗口计算特征描述子,随后将其进行比较以确定地点相似度。值得注意的是,我们的统一框架能够直接迁移来自 P2P 方法的骨干网络而无需任何修改,不仅支持 CNN 还支持 Transformer。为促进训练与评估,我们从 Pitts250k 推导出 Pitts250k-P2E 数据集,并建立了 YQ360,后者是由移动机器人平台采集的首个 P2E 视觉地点识别数据集,旨在更好地模拟真实世界任务场景。大量实验表明,PanoVPR 达到了最先进的性能,并在 Pitts250k-P2E 和 YQ360 上相比之前最佳方法分别获得 3.8% 和 8.0% 的性能提升。代码与数据集将公开于 https://github.com/zafirshi/PanoVPR。

关键词

引用

@article{arxiv.2303.14095,
  title  = {PanoVPR: Towards Unified Perspective-to-Equirectangular Visual Place Recognition via Sliding Windows across the Panoramic View},
  author = {Ze Shi and Hao Shi and Kailun Yang and Zhe Yin and Yining Lin and Kaiwei Wang},
  journal= {arXiv preprint arXiv:2303.14095},
  year   = {2023}
}

备注

Accepted to ITSC 2023. Code and datasets will be made available at https://github.com/zafirshi/PanoVPR