用伪三维残差网络学习时空表示
计算机视觉与模式识别
2017-11-29 v1
摘要
卷积神经网络(CNN)已被视为一类用于图像识别问题的强大模型。然而,利用CNN学习时空视频表示并非易事。少数研究表明,执行3D卷积是捕捉视频中空间与时间维度的有效途径。但是,从零开始开发非常深的3D CNN会带来高昂的计算成本与内存需求。一个合理的问题是:为何不将现成的2D网络复用于3D CNN。本文中,我们在残差学习框架中通过以空间域上的 卷积滤波器(等价于2D CNN)加上 卷积在时间的相邻特征图上构建时间连接来模拟 卷积,设计了多种瓶颈构建块的变体。此外,我们提出一种称为伪三维残差网络(P3D ResNet)的新架构,它利用所有块变体但将其以不同位置组合于ResNet中,遵循通过加深增强结构多样性可提升神经网络能力的理念。我们的P3D ResNet在Sports-1M视频分类数据集上相较3D CNN和基于帧的2D CNN分别取得5.3%和1.8%的明显提升。我们进一步在五个不同基准和三个不同任务上检验了由预训练P3D ResNet生成的视频表示的泛化性能,展现出优于若干SOTA技术的表现。
引用
@article{arxiv.1711.10305,
title = {Learning Spatio-Temporal Representation with Pseudo-3D Residual Networks},
author = {Zhaofan Qiu and Ting Yao and Tao Mei},
journal= {arXiv preprint arXiv:1711.10305},
year = {2017}
}
备注
ICCV 2017; The codes and model of our P3D ResNet are publicly available at: https://github.com/ZhaofanQiu/pseudo-3d-residual-networks