中文

用于语义视频分类的深度架构与集成方法

计算机视觉与模式识别 2018-10-09 v3

摘要

本工作致力于短视频的准确语义标注问题。为此,使用了多种不同的深度网络,涵盖传统的循环神经网络(LSTM、GRU)、时间无关网络(FV、VLAD、BoW)、全连接神经网络中段视听融合以及其他网络。此外,我们还提出了一种基于残差架构的 DNN 用于视频分类,其以显著降低的复杂度取得了最先进的分类性能。进一步地,我们提出了四种面向多样性驱动的多网络集成新方法,其中一种基于快速相关性度量,三种引入了基于 DNN 的组合器。我们表明,通过集成多样化网络可获得显著的性能提升,并研究了促成高多样性的因素。基于大规模的 YouTube8M 数据集,我们对其行为进行了深入的评估与分析。我们表明该集成方法的性能为最先进水平,在 YouTube-8M Kaggle 测试数据上取得了最高准确率。该分类器集成也在 HMDB51 和 UCF101 数据集上进行了评估,结果显示所得方法在使用相似输入特征的情况下与最先进方法具有可比的准确率。

关键词

引用

@article{arxiv.1807.01026,
  title  = {Deep Architectures and Ensembles for Semantic Video Classification},
  author = {Eng-Jon Ong and Sameed Husain and Mikel Bober-Irizar and Miroslaw Bober},
  journal= {arXiv preprint arXiv:1807.01026},
  year   = {2018}
}