用于大规模视频分类的帧级特征聚合
计算机视觉与模式识别
2017-07-05 v1
摘要
本文介绍了我们为 Google Cloud & YouTube-8M 视频理解挑战赛开发的系统,该任务可视为建立在大规模 YouTube-8M 数据集之上的多标签分类问题。我们采用大量技术来聚合所提供的帧级特征表示并生成视频级预测,包括循环神经网络(RNN)的几种变体和广义 VLAD。我们还采用多种融合策略来探索模型间的互补性。就官方指标 GAP@20(前20全局平均精度)而言,我们最佳的融合模型在公开测试数据的 50% 上达到 0.84198,在私有测试数据的 50% 上达到 0.84193,在全球 650 支队伍中排名第四。
引用
@article{arxiv.1707.00803,
title = {Aggregating Frame-level Features for Large-Scale Video Classification},
author = {Shaoxiang Chen and Xi Wang and Yongyi Tang and Xinpeng Chen and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:1707.00803},
year = {2017}
}
备注
Youtube-8M Challenge, 4th place