中文

融合视频、音频与文本的真正多模态 YouTube-8M 视频分类

计算机视觉与模式识别 2017-07-11 v3

摘要

YouTube-8M 视频分类挑战赛要求参赛团队将 70 万个视频分类至 4716 个类别中的一个或多个。在这场 Kaggle 竞赛中,我们使用发布的视频和音频特征,在 650 支参赛队伍中排名前 3%。在此基础上,我们通过在分类中纳入文本信息扩展了原始竞赛,使其成为一种真正融合视觉、音频与文本的多模态方法。新引入的文本数据被称为 YouTube-8M-Text。我们提出了一个联合使用文本、视觉和音频特征的分类框架,并进行了大量实验以量化这一额外模态带来的收益。文本的引入实现了 SOTA 结果,例如在 YouTube-8M-Text 验证数据集上达到 86.7% 的 GAP。

关键词

引用

@article{arxiv.1706.05461,
  title  = {Truly Multi-modal YouTube-8M Video Classification with Video, Audio, and Text},
  author = {Zhe Wang and Kingsley Kuan and Mathieu Ravaut and Gaurav Manek and Sibo Song and Yuan Fang and Seokhwan Kim and Nancy Chen and Luis Fernando D'Haro and Luu Anh Tuan and Hongyuan Zhu and Zeng Zeng and Ngai Man Cheung and Georgios Piliouras and Jie Lin and Vijay Chandrasekhar},
  journal= {arXiv preprint arXiv:1706.05461},
  year   = {2017}
}

备注

8 pages, Accepted to CVPR'17 Workshop on YouTube-8M Large-Scale Video Understanding