中文

大规模多标签视频分类的视频表示学习与潜在概念挖掘

计算机视觉与模式识别 2017-07-26 v3

摘要

我们报告了 CMU Informedia 实验室用于 Google 的 YouTube 8 Million 视频理解挑战赛的系统。在这个多标签视频分类任务中,我们的流水线在我们的评估划分和官方测试集上分别取得了 84.675% 和 84.662% 的 GAP。我们将良好性能归因于三个组件:1) 利用残差连接和超列的精炼视频表示学习;2) 捕获概念间交互的潜在概念挖掘;3) 利用时间片段和加权多模型集成的学习。我们进行了实验以验证和分析我们模型的贡献。我们还分享了一些利用常规方法(例如循环神经网络)用于该大规模视频数据集的视频表示学习的不成功尝试。所有用于复现我们结果的代码公开于 https://github.com/Martini09/informedia-yt8m-release。

关键词

引用

@article{arxiv.1707.01408,
  title  = {Video Representation Learning and Latent Concept Mining for Large-scale Multi-label Video Classification},
  author = {Po-Yao Huang and Ye Yuan and Zhenzhong Lan and Lu Jiang and Alexander G. Hauptmann},
  journal= {arXiv preprint arXiv:1707.01408},
  year   = {2017}
}