在混合深度学习框架中建模视频分类的时空线索
计算机视觉与模式识别
2015-04-08 v1 多媒体
摘要
根据内容语义对视频进行分类是一个具有广泛应用的重要问题。在本文中,我们提出了一种用于视频分类的混合深度学习框架,该框架能够建模视频中的静态空间信息、短期运动以及长期时间线索。具体而言,空间和短期运动特征分别由两个卷积神经网络 (CNN) 提取。这两种基于 CNN 的特征随后在一个正则化特征融合网络中结合以进行分类,该网络能够学习和利用特征关系以提高性能。此外,长短期记忆 (LSTM) 网络被应用于这两个特征之上,以进一步建模更长期的时间线索。这项工作的主要贡献是能够建模视频数据几个重要方面的混合学习框架。我们还表明:(1) 在正则化融合网络中结合空间和短期运动特征优于使用带有 softmax 层的 CNN 进行直接分类和融合;(2) 基于序列的 LSTM 与传统的不考虑时间帧顺序的分类策略高度互补。我们在两个流行且具有挑战性的基准数据集 UCF-101 人体动作和 Columbia Consumer Videos (CCV) 上进行了大量实验。在这两个基准数据集上,我们的框架取得了迄今为止报道的最佳性能:在 UCF-101 上为 ,在 CCV 上为 。
引用
@article{arxiv.1504.01561,
title = {Modeling Spatial-Temporal Clues in a Hybrid Deep Learning Framework for Video Classification},
author = {Zuxuan Wu and Xi Wang and Yu-Gang Jiang and Hao Ye and Xiangyang Xue},
journal= {arXiv preprint arXiv:1504.01561},
year = {2015}
}