中文

用于大规模视频分类的帧级特征聚合

计算机视觉与模式识别 2017-07-05 v1

摘要

本文介绍了我们为 Google Cloud & YouTube-8M 视频理解挑战赛开发的系统,该任务可视为建立在大规模 YouTube-8M 数据集之上的多标签分类问题。我们采用大量技术来聚合所提供的帧级特征表示并生成视频级预测,包括循环神经网络(RNN)的几种变体和广义 VLAD。我们还采用多种融合策略来探索模型间的互补性。就官方指标 GAP@20(前20全局平均精度)而言,我们最佳的融合模型在公开测试数据的 50% 上达到 0.84198,在私有测试数据的 50% 上达到 0.84193,在全球 650 支队伍中排名第四。

关键词

引用

@article{arxiv.1707.00803,
  title  = {Aggregating Frame-level Features for Large-Scale Video Classification},
  author = {Shaoxiang Chen and Xi Wang and Yongyi Tang and Xinpeng Chen and Zuxuan Wu and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:1707.00803},
  year   = {2017}
}

备注

Youtube-8M Challenge, 4th place