深入探究用于学习视频表示的卷积网络
计算机视觉与模式识别
2016-03-02 v4 机器学习
神经与进化计算
摘要
我们提出一种利用门控循环单元循环网络(Gated-Recurrent-Unit Recurrent Networks, GRUs)从我们称之为“percepts”的中间视觉表示中学习视频时空特征的方法。我们的方法依赖于从在大型 ImageNet 数据集上训练的深度卷积网络的所有层级提取的 percepts。虽然高层 percepts 包含高度判别性信息,但它们往往具有较低的空间分辨率。另一方面,低层 percepts 保留了较高的空间分辨率,由此我们可以建模更精细的运动模式。使用低层 percepts 可能导致高维视频表示。为缓解此效应并控制模型参数量,我们引入了 GRU 模型的一种变体,该变体利用卷积操作来强制模型单元的稀疏连接并在输入空间位置上共享参数。我们在人类动作识别(Human Action Recognition)和视频字幕(Video Captioning)任务上对我们的方法进行了实证验证。特别地,我们在 YouTube2Text 数据集上仅使用更简单的文本解码器模型且无需额外的 3D CNN 特征,便取得了与最先进水平(state-of-the-art)相当的结果。
引用
@article{arxiv.1511.06432,
title = {Delving Deeper into Convolutional Networks for Learning Video Representations},
author = {Nicolas Ballas and Li Yao and Chris Pal and Aaron Courville},
journal= {arXiv preprint arXiv:1511.06432},
year = {2016}
}
备注
ICLR 2016