中文

面向 YouTube-8M 数据集多标签视频分类的视频与标签先验编码

计算机视觉与模式识别 2017-07-13 v2

摘要

YouTube-8M 是用于多标签视频分类的最大视频数据集。为了应对这一具有挑战性的数据集上的多标签分类问题,必须解决几个问题,例如视频的时序建模、标签不平衡以及标签之间的相关性。我们开发了一个深度神经网络模型,它由四个组件组成:帧编码器、分类层、标签处理层和损失函数。我们介绍了新提出的方法,并讨论了现有模型在 YouTube-8M 分类任务中如何运作、它们有什么洞察力,以及它们为什么成功(或失败)以实现良好的性能。我们提出的大多数模型性能远高于基线模型,并且我们使用的模型集成在 Kaggle 竞赛中排名第 8。

关键词

引用

@article{arxiv.1706.07960,
  title  = {Encoding Video and Label Priors for Multi-label Video Classification on YouTube-8M dataset},
  author = {Seil Na and Youngjae Yu and Sangho Lee and Jisung Kim and Gunhee Kim},
  journal= {arXiv preprint arXiv:1706.07960},
  year   = {2017}
}

备注

accepted at Youtube-8M CVPR'17 Workshop as Oral Presentation. Kaggle 8th model