中文

并非 3D Re-ID:一种用于鲁棒视频行人重识别的简单单流 2D 卷积

计算机视觉与模式识别 2020-08-18 v2

摘要

基于视频的行人重识别近来受到越来越多的关注,因其在监控视频分析中扮演重要角色。视频 Re-ID 是早期基于图像的行人重识别方法的扩展,通过对每人多帧图像组成的视频学习特征。多数当代视频 Re-ID 方法利用复杂的基于 CNN 的网络架构,使用 3D 卷积或多分支网络来提取时空视频特征。相比之下,本文中我们展示了一种简单单流 2D 卷积网络的优越性能:借助 ResNet50-IBN 架构提取帧级特征,随后通过时间注意力获得片段级特征。这些片段级特征可通过平均泛化为视频级特征,且无显著额外开销。我们的方法采用最佳视频 Re-ID 实践及数据集间迁移学习,在 MARS、PRID2011 与 iLIDS-VID 数据集上分别以 89:62%、97:75%、97:33% 的 rank-1 准确率及 MARS 上 84:61% 的 mAP 优于现有 SOTA 方法,且不像其他当代工作那样依赖复杂且高内存占用的 3D 卷积或多流网络架构。反之,我们的工作表明,2D 卷积网络提取的全局特征足以作为鲁棒 SOTA 视频 Re-ID 的表征。

关键词

引用

@article{arxiv.2008.06318,
  title  = {Not 3D Re-ID: a Simple Single Stream 2D Convolution for Robust Video Re-identification},
  author = {Toby P. Breckon and Aishah Alsehaim},
  journal= {arXiv preprint arXiv:2008.06318},
  year   = {2020}
}

备注

have been submitted to ICPR 2020 and has been ACCEPTED for presentation and inclusion in the proceedings