中文

用于视频分类的双流CNN评估

计算机视觉与模式识别 2015-04-09 v1

摘要

视频包含非常丰富的语义信息。传统手工特征在分析复杂视频语义方面存在不足。受深度学习方法在分析图像、音频和文本数据方面巨大成功的启发,近期大量工作致力于设计用于视频分析的深度网络。在众多实际需求中,基于视频(或视频片段)的主要语义类别(例如“滑雪”)对其进行分类在许多应用中十分有用。本文中,我们进行了深入研究,以探讨可能影响深度网络在视频分类上性能的重要实现选项。我们的评估基于近期的双流卷积神经网络(CNN)流水线进行,该流水线同时使用静态帧和运动光流,并已展示出与最先进方法竞争的性能。为了获得见解并得出实用指南,我们研究了诸多重要选项,包括网络架构、模型融合、学习参数以及最终预测方法。基于这些评估,我们在两个流行的视频分类基准上取得了极具竞争力的结果。我们希望本工作的讨论与结论能帮助相关领域的研究人员快速建立良好基础,以沿着这一非常有前景的方向进行进一步研究。

关键词

引用

@article{arxiv.1504.01920,
  title  = {Evaluating Two-Stream CNN for Video Classification},
  author = {Hao Ye and Zuxuan Wu and Rui-Wei Zhao and Xi Wang and Yu-Gang Jiang and Xiangyang Xue},
  journal= {arXiv preprint arXiv:1504.01920},
  year   = {2015}
}

备注

ACM ICMR'15