批归一化LSTM翻译器引导的大规模视频分类
计算机视觉与模式识别
2017-07-14 v1
摘要
Youtube-8M数据集促进了大规模视频识别技术的发展,正如ImageNet数据集推动了人工智能领域的图像分类、识别与检测。对于这一大型视频数据集,对海量多标签进行分类是一项具有挑战性的任务。通过视角转换,我们提出一种新颖方法,将标签视为单词。具体而言,我们描述了用于多标签视频分类的在线学习方法,该方法由用于视频到句子翻译器的深度循环神经网络引导。我们基于LSTM设计了该翻译器,并发现每个LSTM单元输入前的随机门控有助于我们设计结构细节。此外,我们将批归一化引入模型以改进LSTM模型。由于我们的模型是特征提取器,它们可与其他分类器配合使用。最后,我们报告了模型在大规模Youtube-8M数据集上改进的验证结果以及对进一步改进的探讨。
引用
@article{arxiv.1707.04045,
title = {Large-scale Video Classification guided by Batch Normalized LSTM Translator},
author = {Jae Hyeon Yoo},
journal= {arXiv preprint arXiv:1707.04045},
year = {2017}
}
备注
This is accepted by CVPR2017 Workshop on Youtube-8M Large-scale Video Understanding