中文

用于基于视频的行人重识别的三流卷积网络

计算机视觉与模式识别 2017-12-06 v1 机器学习

摘要

本文旨在开发一种能够充分利用卷积网络特征图的新架构。为此,我们研究了若干基于视频的行人重识别方法,并得到以下发现:1)最大池化仅关注感受野中的最大值,浪费了大量信息。2)具有不同流的网络(即使包含性能最差的一支)优于具有相同流的网络,尽管每支单独使用时均具有最佳性能。3)卷积网络末端的全连接层并非必要。基于这些研究,我们提出一种称为三流卷积网络(TSCN)的新卷积架构。它首先利用不同流学习特征图的不同方面以进行视频的注意力时空融合,然后将它们合并以学习一些联合特征。为进一步利用特征图,采用多尺度与上采样策略设计了两种架构。在iLIDS-VID、PRID-2011和MARS数据集上的对比实验表明,所提架构在特征提取方面显著优于最先进模型。

关键词

引用

@article{arxiv.1712.01652,
  title  = {Three-Stream Convolutional Networks for Video-based Person Re-Identification},
  author = {Zeng Yu and Tianrui Li and Ning Yu and Xun Gong and Ke Chen and Yi Pan},
  journal= {arXiv preprint arXiv:1712.01652},
  year   = {2017}
}