中文

YouTube-8M: 一个大规模视频分类基准

计算机视觉与模式识别 2016-09-29 v1

摘要

计算机视觉领域的许多最新进展得益于大规模数据集。机器学习的开源软件包和廉价的商品化硬件降低了大规模探索新方法的门槛。如今已能在数天内基于数百万样本训练模型。尽管图像理解领域存在如 ImageNet 这样的大规模数据集,但目前尚无同等规模的视频分类数据集。本文介绍了 YouTube-8M,这是目前最大的多标签视频分类数据集,由约 800 万个视频(50 万小时)组成,并使用包含 4800 个视觉实体的词表进行了标注。为获取视频及其标签,我们使用了 YouTube 视频标注系统,该系统以视频的主题对其进行标注。虽然这些标签由机器生成,但它们具有高精确度,且源自包括元数据和查询点击信号在内的多种基于人类的信号。我们采用自动与人工相结合的筛选策略对视频标签(知识图谱实体)进行了过滤,包括询问人工评估者这些标签是否具有视觉可辨识性。随后,我们以每秒一帧的频率对每个视频进行解码,并使用在 ImageNet 上预训练的深度 CNN 提取紧邻分类层之前的隐藏表示。最后,我们对帧特征进行了压缩,并将特征与视频级标签公开供下载。我们在该数据集上训练了多种(轻量级)分类模型,使用常用的评估指标对其进行评估,并将其作为基线结果报告。尽管该数据集规模庞大,但我们的部分模型在单机上使用 TensorFlow 不到一天即可训练至收敛。我们计划发布用于训练 TensorFlow 模型和计算评估指标的代码。

关键词

引用

@article{arxiv.1609.08675,
  title  = {YouTube-8M: A Large-Scale Video Classification Benchmark},
  author = {Sami Abu-El-Haija and Nisarg Kothari and Joonseok Lee and Paul Natsev and George Toderici and Balakrishnan Varadarajan and Sudheendra Vijayanarasimhan},
  journal= {arXiv preprint arXiv:1609.08675},
  year   = {2016}
}

备注

10 pages