用于事件检测的判别式 CNN 视频表示
计算机视觉与模式识别
2014-11-17 v1
摘要
在本文中,当仅有有限的硬件资源可用时,我们提出了一种用于大规模视频数据集事件检测的判别式视频表示。本文的重点是有效利用深度卷积神经网络 (CNNs) 来推进事件检测,而现有的 CNN 工具包仅能提取帧级静态描述符。本文对 CNN 视频表示的推断做出了两项贡献。首先,虽然平均池化和最大池化长期以来是聚合帧级静态特征的标准方法,但我们表明通过利用适当的编码方法可以显著提高性能。其次,我们提出使用一组潜在概念描述符作为帧描述符,这在丰富视觉信息的同时保持了计算上的可负担性。这两项贡献的整合使得在最大视频数据集上的事件检测取得了新的最先进水平 (state-of-the-art) 性能。与已被公认为最佳事件检测视频表示的改进型稠密轨迹 (improved Dense Trajectories) 相比,我们的新表示将 TRECVID MEDTest 14 数据集的平均精度均值 (mAP) 从 27.6% 提高到 36.8%,将 TRECVID MEDTest 13 数据集的 mAP 从 34.0% 提高到 44.6%。这项工作是我们 CMU-Informedia 团队在 TRECVID MED 2014 竞赛中获胜解决方案的核心部分。
引用
@article{arxiv.1411.4006,
title = {A Discriminative CNN Video Representation for Event Detection},
author = {Zhongwen Xu and Yi Yang and Alexander G. Hauptmann},
journal= {arXiv preprint arXiv:1411.4006},
year = {2014}
}