中文

批归一化LSTM翻译器引导的大规模视频分类

计算机视觉与模式识别 2017-07-14 v1

摘要

Youtube-8M数据集促进了大规模视频识别技术的发展,正如ImageNet数据集推动了人工智能领域的图像分类、识别与检测。对于这一大型视频数据集,对海量多标签进行分类是一项具有挑战性的任务。通过视角转换,我们提出一种新颖方法,将标签视为单词。具体而言,我们描述了用于多标签视频分类的在线学习方法,该方法由用于视频到句子翻译器的深度循环神经网络引导。我们基于LSTM设计了该翻译器,并发现每个LSTM单元输入前的随机门控有助于我们设计结构细节。此外,我们将批归一化引入模型以改进LSTM模型。由于我们的模型是特征提取器,它们可与其他分类器配合使用。最后,我们报告了模型在大规模Youtube-8M数据集上改进的验证结果以及对进一步改进的探讨。

关键词

引用

@article{arxiv.1707.04045,
  title  = {Large-scale Video Classification guided by Batch Normalized LSTM Translator},
  author = {Jae Hyeon Yoo},
  journal= {arXiv preprint arXiv:1707.04045},
  year   = {2017}
}

备注

This is accepted by CVPR2017 Workshop on Youtube-8M Large-scale Video Understanding