English

Initialization Strategies of Spatio-Temporal Convolutional Neural Networks

Computer Vision and Pattern Recognition 2015-03-26 v1 Machine Learning

Abstract

We propose a new way of incorporating temporal information present in videos into Spatial Convolutional Neural Networks (ConvNets) trained on images, that avoids training Spatio-Temporal ConvNets from scratch. We describe several initializations of weights in 3D Convolutional Layers of Spatio-Temporal ConvNet using 2D Convolutional Weights learned from ImageNet. We show that it is important to initialize 3D Convolutional Weights judiciously in order to learn temporal representations of videos. We evaluate our methods on the UCF-101 dataset and demonstrate improvement over Spatial ConvNets.

Keywords

Cite

@article{arxiv.1503.07274,
  title  = {Initialization Strategies of Spatio-Temporal Convolutional Neural Networks},
  author = {Elman Mansimov and Nitish Srivastava and Ruslan Salakhutdinov},
  journal= {arXiv preprint arXiv:1503.07274},
  year   = {2015}
}

Comments

Technical Report

R2 v1 2026-06-22T09:01:30.763Z