用于视频行人重识别的多阶段时空聚合Transformer
计算机视觉与模式识别
2023-01-03 v1
摘要
近年来,Transformer架构在基于视频的行人重识别任务中展现出优越性。受视频表示学习启发,这些方法主要聚焦于设计模块以提取具信息量的空间与时间特征。然而,它们在提取局部属性与全局身份信息方面仍受限,而这对行人重识别任务至关重要。本文中,我们提出一种新颖的多阶段时空聚合Transformer(MSTAT),含两个新设计的代理嵌入模块以解决上述问题。具体而言,MSTAT由三个阶段组成,分别从视频片段编码属性关联、身份关联及属性-身份关联信息,实现对输入行人的整体感知。我们融合所有阶段输出用于最终识别。实践中,为节省计算成本,各阶段首先采用时空聚合(STA)模块沿空间与时间维度分别进行自注意力操作。我们进一步引入属性感知与身份感知代理嵌入模块(AAP与IAP),在不同阶段提取具信息量与判别性的特征表示。它们均通过采用新设计的具特定含义的自注意力操作实现。此外,还引入时间块洗牌以进一步提升模型鲁棒性。大量实验结果证明了所提模块在从视频提取信息量与判别性信息上的有效性,并表明MSTAT在各标准基准上取得了最先进的准确率。
引用
@article{arxiv.2301.00531,
title = {Multi-Stage Spatio-Temporal Aggregation Transformer for Video Person Re-identification},
author = {Ziyi Tang and Ruimao Zhang and Zhanglin Peng and Jinrui Chen and Liang Lin},
journal= {arXiv preprint arXiv:2301.00531},
year = {2023}
}
备注
This manuscript was just accepted for publication as a regular paper in the IEEE Transactions on Multimedia. We have uploaded source PdfLateX files this time