中文

无繁冗修饰的基于视频的人员重识别

计算机视觉与模式识别 2021-09-23 v2

摘要

基于视频的人员重识别(Re-ID)旨在将视频轨迹片段与裁剪出的视频帧进行匹配,以在不同摄像头下识别行人。然而,由于使用过时方法生成的检测与跟踪结果不完善,这些裁剪出的轨迹片段存在严重的空间与时间错位。为解决此问题,我们提出一个简单的重新检测与链接(DL)模块,通过对裁剪轨迹片段应用基于深度学习的检测与跟踪,可有效减少这些非预期噪声。此外,我们引入一种称为由粗到细轴向注意力网络(CF-AAN)的改进模型。在典型的非局部网络基础上,我们将非局部模块替换为三个一维位置敏感轴向注意力,并辅以我们提出的由粗到细结构。借助所开发的 CF-AAN,相较于原始非局部操作,我们不仅能显著降低计算成本,还能在大规模 MARS 数据集上取得当前最优性能(rank-1 为 91.3%,mAP 为 86.5%)。同时,仅采用我们的 DL 模块进行数据对齐,令我们惊讶的是,若干基线模型即可取得优于或与当前最优方法相当的结果。此外,我们发现 MARS 测试数据不仅存在轨迹片段身份标签的错误,还存在评估协议的错误。我们希望我们的工作能帮助社区在免去时空对齐与数据集噪声困扰的情况下,进一步推动不变表征的发展。代码、修正标签、评估协议以及对齐数据将发布于 https://github.com/jackie840129/CF-AAN。

关键词

引用

@article{arxiv.2105.10678,
  title  = {Video-based Person Re-identification without Bells and Whistles},
  author = {Chih-Ting Liu and Jun-Cheng Chen and Chu-Song Chen and Shao-Yi Chien},
  journal= {arXiv preprint arXiv:2105.10678},
  year   = {2021}
}

备注

This paper was accepted by CVPR 2021 Biometrics Workshop