中文

用于视频理解的分层深度循环架构

计算机视觉与模式识别 2017-07-12 v1

摘要

本文介绍了我们为 Youtube-8M 视频理解挑战赛开发的系统,该挑战赛使用了大规模基准数据集进行多标签视频分类。所提出的框架包含分层深度架构,包括帧级序列建模部分和视频级分类部分。在帧级序列建模部分,我们探索了一组方法,包括 Pooling-LSTM (PLSTM)、Hierarchical-LSTM (HLSTM)、Random-LSTM (RLSTM),以解决视频中大量帧的问题。我们还引入了两种注意力池化方法,单注意力池化 (ATT) 和乘注意力池化 (Multi-ATT),以便我们能更多关注视频中的信息帧并忽略无用帧。在视频级分类部分,提出了两种方法来提升分类性能,即 Hierarchical-Mixture-of-Experts (HMoE) 和 Classifier Chains (CC)。我们最终的提交是由 18 个子模型组成的集成。根据官方评估指标 Global Average Precision (GAP) at 20,我们的最佳提交在公开 50% 测试数据集上达到 0.84346,在私有 50% 测试数据上达到 0.84333。

关键词

引用

@article{arxiv.1707.03296,
  title  = {Hierarchical Deep Recurrent Architecture for Video Understanding},
  author = {Luming Tang and Boyang Deng and Haiyu Zhao and Shuai Yi},
  journal= {arXiv preprint arXiv:1707.03296},
  year   = {2017}
}

备注

Accepted as Classification Challenge Track paper in CVPR 2017 Workshop on YouTube-8M Large-Scale Video Understanding