3D PersonVLAD:用于基于视频的行人重识别的深度全局表示学习
计算机视觉与模式识别
2019-02-07 v3
摘要
本文引入了一种用于基于视频的行人重识别(re-ID)的全局视频表示,该表示聚合了整个视频范围内的局部3D特征。现有大多数方法依赖2D卷积网络(ConvNets)提取逐帧深度特征,并通过时间池化生成视频级表示。然而,2D ConvNets在卷积后立即丢失时间输入信息,且独立的时间池化在捕捉较短序列中的人体运动时存在局限性。为此,我们提出了一种\textit{全局}视频表示(3D PersonVLAD),作为3D ConvNets的新颖补充层,用于捕捉全长视频中的外观与运动动态。然而,由于遮挡和不对齐问题,对每一视频帧进行完整编码并计算跨所有帧的聚合全局表示极具挑战性。为解决此问题,我们提出的网络进一步增加了3D部件对齐模块,通过软注意力模块学习局部特征。这些被关注的特征经统计聚合后产生具有身份判别性的表示。我们的全局3D特征在三个基准数据集上取得了SOTA结果:MARS \cite{MARS}、iLIDS-VID \cite{VideoRanking}和 PRID 2011。
引用
@article{arxiv.1812.10222,
title = {3D PersonVLAD: Learning Deep Global Representations for Video-based Person Re-identification},
author = {Lin Wu and Yang Wang and Ling Shao and Meng Wang},
journal= {arXiv preprint arXiv:1812.10222},
year = {2019}
}
备注
Accepted to appear at IEEE Transactions on Neural Networks and Learning Systems