YouTube-8M 视频理解挑战赛的 Monkeytyping 解决方案
计算机视觉与模式识别
2017-06-19 v1
摘要
本文描述了 monkeytyping 团队在 YouTube-8M 视频理解挑战赛中获得第二名的最终解决方案。该挑战赛使用的数据集是多标签视频分类的大规模基准。我们扩展了文献 [1] 中的工作,并提出了针对帧序列建模的若干改进。我们提出了一种名为 Chaining 的网络结构,能够更好地捕捉标签之间的交互。此外,我们报告了在处理多尺度信息和注意力池化方面的方法。另外,我们发现将模型集成的输出作为训练中的辅助目标可以提升单模型的性能。我们报告了在 bagging、boosting、cascade 和 stacking 方面的实验,并提出了一种称为注意力加权堆叠的 stacking 算法。我们最终提交的集成由 74 个子模型组成,所有子模型均列在附录中。
引用
@article{arxiv.1706.05150,
title = {The Monkeytyping Solution to the YouTube-8M Video Understanding Challenge},
author = {He-Da Wang and Teng Zhang and Ji Wu},
journal= {arXiv preprint arXiv:1706.05150},
year = {2017}
}
备注
Submitted to the CVPR 2017 Workshop on YouTube-8M Large-Scale Video Understanding