中文

用于基于视频的人员重识别的时空表征分解

计算机视觉与模式识别 2021-08-17 v2

摘要

尽管基于视频的人员重识别(re-ID)近期取得了诸多进展,当前最先进水平仍受制于各种人员间外观相似、遮挡与帧错位等现实常见挑战。为缓解这些问题,我们提出时空表征分解(STRF),一种灵活的新计算单元,可与大多数现有用于重识别的 3D 卷积神经网络架构结合使用。STRF 相对于先前工作的关键创新在于显式地学习判别性时间与空间特征的路径,且各组件进一步分解以捕获互补的行人特定外观与运动信息。具体而言,时间分解包含两支,分别用于随时间变化不大的静态特征(如衣服颜色)与随时间变化的动态特征(如行走模式)。此外,空间分解也包含两支,以学习全局(粗粒度段)与局部(细粒度段)外观特征,其中局部特征在遮挡或空间错位情况下尤为有用。这两种分解操作共同构成了我们参数轻量的 STRF 单元的模块化架构,其可插入任意两个 3D 卷积层之间,形成端到端学习框架。我们通过实验表明,STRF 在三个基准上利用标准人员重识别评估协议提升了多种现有基线架构的性能,同时展示了新的最先进结果。

关键词

引用

@article{arxiv.2107.11878,
  title  = {Spatio-Temporal Representation Factorization for Video-based Person Re-Identification},
  author = {Abhishek Aich and Meng Zheng and Srikrishna Karanam and Terrence Chen and Amit K. Roy-Chowdhury and Ziyan Wu},
  journal= {arXiv preprint arXiv:2107.11878},
  year   = {2021}
}

备注

Accepted at IEEE ICCV 2021, Includes Supplementary Material