中文

用于基于视频的人员重识别的卷积时间注意力模型

计算机视觉与模式识别 2019-04-11 v2

摘要

基于视频的人员重识别的目标是匹配两段输入视频,使得若两段视频包含同一人,则它们的距离较小。人员重识别的一种常见方法是先提取视频中所有帧的图像特征,再聚合所有特征形成视频级特征。随后可用两段视频的视频级特征计算其距离。本文中,我们提出一种时间注意力方法,用于将帧级特征聚合为用于重识别的视频级特征向量。我们的方法源于如下事实:并非视频中所有帧都具有同等信息量。我们提出一种全卷积时间注意力模型来生成注意力分数。全卷积网络(FCN)已广泛用于语义分割以生成二维输出图。本文将基于视频的人员重识别表述为类似于语义分割的序列标注问题。我们建立二者间的联系并修改 FCN 以生成表示每帧重要性的注意力分数。在三个不同基准数据集(即 iLIDS-VID、PRID-2011 和 SDU-VID)上的大量实验表明,我们所提方法优于其他最先进的方案。

关键词

引用

@article{arxiv.1904.04492,
  title  = {Convolutional Temporal Attention Model for Video-based Person Re-identification},
  author = {Tanzila Rahman and Mrigank Rochan and Yang Wang},
  journal= {arXiv preprint arXiv:1904.04492},
  year   = {2019}
}

备注

6 pages, 4 figures, ICME 2019