用于动作识别的基于3D残差网络的时空特征学习
计算机视觉与模式识别
2017-08-28 v1
摘要
具有时空3D卷积核的卷积神经网络(3D CNNs)能够直接从视频中提取时空特征以进行动作识别。尽管3D卷积核因其参数量大而容易过拟合,但3D CNNs通过使用近期的大型视频数据库得到了极大改进。然而,相比于非常深的2D CNNs(如残差网络(ResNets))的成功,3D CNNs的架构相对较浅。在本文中,我们提出了一种基于ResNets的3D CNNs,以期获得更好的动作表示。我们详细描述了3D ResNets的训练过程。我们在ActivityNet和Kinetics数据集上对3D ResNets进行了实验评估。在Kinetics上训练的3D ResNets尽管模型参数量巨大,但并未出现过拟合,并且取得了比相对较浅的网络(如C3D)更好的性能。我们的代码和预训练模型(如Kinetics和ActivityNet)已在 https://github.com/kenshohara/3D-ResNets 上公开。
引用
@article{arxiv.1708.07632,
title = {Learning Spatio-Temporal Features with 3D Residual Networks for Action Recognition},
author = {Kensho Hara and Hirokatsu Kataoka and Yutaka Satoh},
journal= {arXiv preprint arXiv:1708.07632},
year = {2017}
}
备注
To appear in ICCV 2017 Workshop (Chalearn)