SA-CNN:基于卷积神经网络的动态场景分类
计算机视觉与模式识别
2015-09-01 v2
摘要
近年来,将自然动态场景视频分类到适当类别中的任务引起了大量关注。当用于捕获视频的相机是运动的时候,该问题变得尤其具有挑战性。在本文中,我们分析了各种预训练卷积神经网络(CNN)模型上统计聚合(SA)技术的性能以解决此问题。所提方法通过提取视频中若干帧的CNN激活特征,然后使用聚合方案以获得视频的鲁棒特征描述符来工作。我们通过结果表明,对于Maryland和YUPenn数据集,所提方法性能优于现有最佳方法。所获得的最终描述符足以区分动态场景,甚至能够处理相机运动占主导且场景动态复杂的情况。此外,本文展示了关于各种聚合方法及其组合性能的广泛研究。我们在两个公开可用数据集——Maryland和YUPenn上,将所提方法与其他动态场景分类算法进行比较,以证明所提方法的优越性能。
引用
@article{arxiv.1502.05243,
title = {SA-CNN: Dynamic Scene Classification using Convolutional Neural Networks},
author = {Aalok Gangopadhyay and Shivam Mani Tripathi and Ishan Jindal and Shanmuganathan Raman},
journal= {arXiv preprint arXiv:1502.05243},
year = {2015}
}