中文

用于基于视频的行人重识别的多样性正则化时空注意力模型

计算机视觉与模式识别 2018-03-28 v1

摘要

基于视频的行人重识别旨在跨非重叠摄像头匹配行人的视频片段。现有的大多数方法通过对每一视频帧进行整体编码并计算所有帧的聚合表示来解决此问题。在实际场景中,行人通常会被部分遮挡,这可能会破坏提取的特征。相反,我们提出了一种新的时空注意力模型,能够自动发现一组多样化的显著身体部位。这使得模型能够从所有帧中提取有用信息,而不受遮挡和不对齐的影响。该网络学习多个空间注意力模型,并采用多样性正则化项以确保多个模型不会发现相同的身体部位。从局部图像区域提取的特征由空间注意力模型组织,并使用时间注意力进行组合。因此,该网络利用整个视频序列中最佳可用图像块,学习人脸、躯干和其他身体部位的潜在表示。在三个数据集上的广泛评估表明,我们的框架在多个指标上均大幅优于 SOTA 方法。

关键词

引用

@article{arxiv.1803.09882,
  title  = {Diversity Regularized Spatiotemporal Attention for Video-based Person Re-identification},
  author = {Shuang Li and Slawomir Bak and Peter Carr and Xiaogang Wang},
  journal= {arXiv preprint arXiv:1803.09882},
  year   = {2018}
}