中文

面向视频行人重识别的深度循环卷积网络:一种端到端方法

计算机视觉与模式识别 2016-06-14 v2

摘要

本文提出一种端到端方法,同时学习时空特征及其对应的相似性度量,用于基于视频的行人重识别。给定一个人的视频序列,从深度卷积网络所有层级提取的每一帧特征能够保留更高的空间分辨率,从而建模更精细的运动模式。这些底层视觉感知被引入一种循环模型变体,以刻画时间步之间的时序变化。随后,利用时序池化汇总所有时间步的特征,生成完整序列的整体特征表示。深度卷积网络、循环层和时序池化被联合训练,以从输入的时间序列对中提取可比较的隐单元表示,并计算其对应的相似度值。所提框架结合了时间序列建模与度量学习,以联合学习相关特征和行人时间序列之间的良好相似性度量。实验表明,我们的方法在两个主要公开数据集iLIDS-VID和PRID 2011上达到了视频行人重识别的当前最优性能。

关键词

引用

@article{arxiv.1606.01609,
  title  = {Deep Recurrent Convolutional Networks for Video-based Person Re-identification: An End-to-End Approach},
  author = {Lin Wu and Chunhua Shen and Anton van den Hengel},
  journal= {arXiv preprint arXiv:1606.01609},
  year   = {2016}
}

备注

11 pages