STA:面向大规模基于视频的人员重识别的时空注意力
计算机视觉与模式识别
2020-05-01 v1
摘要
本文中,我们提出一种新颖的时空注意力(STA)方法来解决视频中的大规模人员重识别任务。与大多数现有方法简单地使用帧级聚合(如平均池化)计算视频片段的表示不同,所提出的 STA 采用了一种更有效的方法生成鲁棒的片段级特征表示。具体而言,我们的 STA 充分挖掘目标人物在空间和时间维度上具有判别力的部位,通过帧间正则化得到二维注意力分数矩阵,以衡量不同帧中空间部位的重要性。因此,可根据由挖掘出的二维注意力分数矩阵引导的加权和操作生成更鲁棒的片段级特征表示。以此方式,STA 能够很好地应对基于视频的人员重识别中的姿态变化和局部遮挡等挑战性情况。我们在两个大规模基准 MARS 和 DukeMTMC-VideoReID 上进行了充分实验。特别地,在 MARS 上 mAP 达到 87.7%,以超过 11.6% 的大幅优势显著优于当前最优方法。
引用
@article{arxiv.1811.04129,
title = {STA: Spatial-Temporal Attention for Large-Scale Video-based Person Re-Identification},
author = {Yang Fu and Xiaoyang Wang and Yunchao Wei and Thomas Huang},
journal= {arXiv preprint arXiv:1811.04129},
year = {2020}
}
备注
Accepted as a conference paper at AAAI 2019