中文

跨平台视频行人重识别:新基准数据集与适配方法

计算机视觉与模式识别 2024-09-04 v2

摘要

在本文中,我们构建了一个大规模基准数据集G2A-VReID,用于地面到空中视频行人重识别,包含185,907张图像和5,576个轨迹,包含2,788个不同身份。据我们所知,这是首个面向地面到空中场景的视频ReID数据集。G2A-VReID数据集具有以下特征:1)剧烈的视角变化;2)大量标注身份;3)丰富的户外场景;4)分辨率的巨大差异。此外,我们提出了一种新的跨平台ReID基准方法,通过视觉语言模型(即CLIP)将跨平台视觉对齐问题转化为视觉语义对齐,并应用参数高效的Video Set-Level-Adapter模块将基于图像的基础模型适配到视频ReID任务中,称为VSLA-CLIP。此外,为了进一步减少平台间的巨大差异,我们还设计了平台桥接提示,以实现高效的视觉特征对齐。大量实验证明了所提方法在所有现有视频ReID数据集和我们提出的G2A-VReID数据集上的优越性。

关键词

引用

@article{arxiv.2408.07500,
  title  = {Cross-Platform Video Person ReID: A New Benchmark Dataset and Adaptation Approach},
  author = {Shizhou Zhang and Wenlong Luo and De Cheng and Qingchun Yang and Lingyan Ran and Yinghui Xing and Yanning Zhang},
  journal= {arXiv preprint arXiv:2408.07500},
  year   = {2024}
}

备注

Published at ECCV 2024