中文

利用图像训练的 CNN 架构进行无约束视频分类

计算机视觉与模式识别 2015-05-11 v3

摘要

我们深入探讨了使用为图像分类训练的卷积神经网络 (CNN) 进行视频中事件检测的不同策略。我们研究了执行空间和时序池化、特征归一化、CNN 层选择以及分类器选择的不同方法。在这些维度上做出明智的选择,使得性能相较于迄今为止使用的更朴素的方法有了非常显著的提升。我们在具有挑战性的 TRECVID MED'14 数据集上评估了我们的方法,使用了两种在 ImageNet 上预训练的流行 CNN 架构。在这个 MED'14 数据集上,我们完全基于图像训练 CNN 特征的方法可以优于几种最先进的非 CNN 模型。我们提出的基于 CNN 和运动特征的后期融合可以将 MED'14 上的平均精度均值 (mAP) 从 34.95% 进一步提高到 38.74%。该融合方法在具有挑战性的 UCF-101 数据集上实现了最先进的分类性能。

关键词

引用

@article{arxiv.1503.04144,
  title  = {Exploiting Image-trained CNN Architectures for Unconstrained Video Classification},
  author = {Shengxin Zha and Florian Luisier and Walter Andrews and Nitish Srivastava and Ruslan Salakhutdinov},
  journal= {arXiv preprint arXiv:1503.04144},
  year   = {2015}
}