SCAN:用于视频行人重识别的自注意与协同注意网络
计算机视觉与模式识别
2019-09-04 v4
摘要
视频行人重识别近年来备受关注。其旨在匹配来自不同摄像机视角的行人图像序列。以往方法通常从三方面改进该任务:a) 选择更具判别力的帧,b) 生成信息更丰富的时序表示,c) 开发更有效的距离度量。为解决上述问题,我们提出一种新颖且实用的视频行人重识别深度架构,称为自注意与协同注意网络(Self-and-Collaborative Attention Network, SCAN)。它具有若干优越特性。首先,SCAN 采用非参数注意力机制精炼视频的序列内与序列间特征表示,并为每个视频输出自注意与协同特征表示,使判别性帧在探针与图库序列间对齐。其次,超越现有模型,提出一种广义成对相似性度量来计算视频对的相似性特征表示,从而通过二分类器计算匹配分数。第三,还引入密集片段分割策略以生成丰富的探针-图库对来优化模型。大量实验证明了 SCAN 的有效性,其在 iLIDS-VID、PRID2011 和 MARS 数据集上分别优于性能最佳的基线。
引用
@article{arxiv.1807.05688,
title = {SCAN: Self-and-Collaborative Attention Network for Video Person Re-identification},
author = {Ruimao Zhang and Hongbin Sun and Jingyu Li and Yuying Ge and Liang Lin and Ping Luo and Xiaogang Wang},
journal= {arXiv preprint arXiv:1807.05688},
year = {2019}
}
备注
10 pages, 5 figures