用于动作识别的深度卷积特征多核学习
计算机视觉与模式识别
2017-11-15 v2 机器学习
摘要
使用深度卷积网络的图像理解已达到人类水平的表现,然而与之密切相关的视频理解问题,尤其是动作识别,尚未达到所需的成熟度。我们将基于多核的支持向量机(SVM)与多流深度卷积神经网络相结合,在51类活动识别问题(HMDB-51数据集)上实现了接近SOTA的性能;由于相机视角、视频质量等方面的异质性,这个特定的数据集对深度神经网络已被证明极具挑战性。由此产生的架构被命名为柱网络,因为每个(非常)深的神经网络都作为分层分类器的支柱。此外,我们说明了手工特征如改进的密集轨迹和Multi-skip Feature Stacking (MIFS),作为额外的支柱,可以进一步提升性能。
引用
@article{arxiv.1707.06923,
title = {Multi-kernel learning of deep convolutional features for action recognition},
author = {Biswa Sengupta and Yu Qian},
journal= {arXiv preprint arXiv:1707.06923},
year = {2017}
}
备注
ICCV 2017 Workshop on Video and Language Understanding: MovieQA and the Large Scale Movie Description Challenge