利用深度神经网络进行大规模 YouTube-8M 视频理解
计算机视觉与模式识别
2017-06-15 v1
摘要
视频分类问题已被研究多年。卷积神经网络(CNN)在图像识别任务中的成功为研究人员创建更先进的视频分类方法提供了强大动力。由于视频具有时序内容,长短期记忆(LSTM)网络成为允许对长期时序线索进行建模的便捷工具。这两种方法都需要大量的输入数据集。在本文中,提供了三种模型以利用最近发布的大规模 YouTube-8M 数据集来解决视频分类问题。第一个模型基于帧池化方法。另外两个模型基于 LSTM 网络。第三个模型中使用了混合专家(Mixture of Experts)中间层,从而在不显著增加计算量的情况下提高模型容量。此外,还进行了一系列用于处理不平衡训练数据的实验。
引用
@article{arxiv.1706.04488,
title = {Large-Scale YouTube-8M Video Understanding with Deep Neural Networks},
author = {Manuk Akopyan and Eshsou Khashba},
journal= {arXiv preprint arXiv:1706.04488},
year = {2017}
}
备注
6 pages, 5 figures, 3 tables