用于基于视频行人重识别的多尺度三维卷积网络
计算机视觉与模式识别
2018-11-20 v1
摘要
本文提出一种双流卷积网络,以提取基于视频的行人重识别 (ReID) 的时空线索。该网络中的时间流通过在 2D CNN 网络中插入若干多尺度三维 (M3D) 卷积层构建。所得到的 M3D 卷积网络向 2D CNN 中引入了少量参数,却获得了多尺度时间特征学习能力。凭借这一紧凑架构,M3D 卷积网络也比现有三维卷积网络更高效且更易优化。时间流进一步引入残差注意力层 (RAL) 以精炼时间特征。通过以残差方式联合学习时空注意力掩码,RAL 识别出具有判别力的空间区域与时间线索。我们网络中的另一流由 2D CNN 实现,用于空间特征提取。来自两流的空间与时间特征最终被融合用于基于视频的行人 ReID。在三个广泛使用的基准数据集 MARS、PRID2011 和 iLIDS-VID 上的评估表明,我们的方法相对于现有三维卷积网络与最先进 (state-of-the-art) 方法具有显著优势。
引用
@article{arxiv.1811.07468,
title = {Multi-scale 3D Convolution Network for Video Based Person Re-Identification},
author = {Jianing Li and Shiliang Zhang and Tiejun Huang},
journal= {arXiv preprint arXiv:1811.07468},
year = {2018}
}
备注
AAAI, 2019