中文

MMS-VPR:面向步行环境的多模态街景视觉地点识别数据集与基准

计算机视觉与模式识别 2026-02-18 v2 人工智能 机器学习

摘要

现有的视觉地点识别(VPR)数据集主要依赖车载影像,提供有限的多模态多样性,并在非西方城市背景下未能充分代表密集的步行街景。我们引入MMS-VPR,一个规模庞大的多模态数据集,用于步行环境中的街景地点识别。MMS-VPR包含110,529张图片和2,527段视频片段,分布在中国成都约70,800平方米的开放式商业区的208个地点。现场数据于2024年收集,而社交媒体数据跨越七年(2019-2025),提供了细粒度的时间粒度和长期的时间覆盖。每个地点都包含全天候的日夜覆盖、多种观察角度,以及包括GPS坐标、时间戳和语义文本元数据在内的多模态注释。我们进一步发布了MMS-VPRlib,一个统一的基准平台,将常用VPR数据集和最新方法整合在标准化、可复现的管道下。MMS-VPRlib提供了数据预处理、多模态建模(CNN/RNN/Transformer)、信号增强、对齐、融合和绩效评估等模块化组件。该平台超越了传统仅图像范式,使能够系统性地利用补充的视觉、视频和文本模态。数据集可在https://huggingface.co/datasets/Yiwei-Ou/MMS-VPR获取,基准平台可在https://github.com/yiasun/MMS-VPRlib获取。

关键词

引用

@article{arxiv.2505.12254,
  title  = {MMS-VPR: Multimodal Street-Level Visual Place Recognition Dataset and Benchmark},
  author = {Yiwei Ou and Xiaobin Ren and Ronggui Sun and Guansong Gao and Kaiqi Zhao and Manfredo Manfredini},
  journal= {arXiv preprint arXiv:2505.12254},
  year   = {2026}
}

备注

Under review