中文

基于视频的人员重识别的深度耦合卷积-Transformer与时空互补学习

计算机视觉与模式识别 2023-04-28 v1 信息检索 多媒体

摘要

先进的深度卷积神经网络(CNNs)在基于视频的人员重识别(Re-ID)中已展现出巨大成功。然而,它们通常聚焦于人体最显著的区域,全局表征能力有限。近来,人们观察到Transformer通过全局观测探索块间关系以提升性能。本工作中,我们兼顾两者,提出一种新颖的时空互补学习框架,称为深度耦合卷积-Transformer(DCCT),用于高性能的基于视频的人员重识别。首先,我们将CNNs与Transformers耦合以提取两类视觉特征,并通过实验验证其互补性。进一步,在空间上,我们提出互补内容注意力(CCA)以利用耦合结构并引导独立特征进行空间互补学习。在时间上,提出层次化时间聚合(HTA)以逐步捕获帧间依赖并编码时间信息。此外,利用门控注意力将聚合的时间信息送入CNN与Transformer分支以实现时间互补学习。最后,我们引入自蒸馏训练策略,将优越的时空知识迁移至骨干网络,以获得更高精度与更高效率。由此,来自同一视频的两类典型特征被机械地整合为信息更丰富的表征。在四个公开Re-ID基准上的大量实验表明,我们的框架能够取得优于大多数最先进方法的性能。

关键词

引用

@article{arxiv.2304.14122,
  title  = {Deeply-Coupled Convolution-Transformer with Spatial-temporal Complementary Learning for Video-based Person Re-identification},
  author = {Xuehu Liu and Chenyang Yu and Pingping Zhang and Huchuan Lu},
  journal= {arXiv preprint arXiv:2304.14122},
  year   = {2023}
}

备注

Accepted by TNNLS, including 11 pages,8 figures,8 tables. Modifications may be performed