面向视频分类的可学习池化与上下文门控
计算机视觉与模式识别
2018-03-06 v2
摘要
当前的视频分析方法通常使用预训练的卷积神经网络(CNN)提取帧级特征,然后通过简单的时间平均或更复杂的循环神经网络(如长短期记忆网络 LSTM 或门控循环单元 GRU)在时间维度上进行聚合。本文重新审视了现有的视频表示,并研究了时间聚合的替代方法。我们首先探索了基于聚类的聚合层,并提出了一种聚合音频和视觉特征的双流架构。随后,我们引入了一个可学习的非线性单元,称为上下文门控(Context Gating),旨在建模网络激活之间的相互依赖关系。实验结果显示了这两项改进在视频分类任务中的优势。特别是,我们在大规模多模态 Youtube-8M v2 数据集上评估了我们的方法,并在 Youtube 8M 大规模视频理解挑战赛中超越了所有其他方法。
引用
@article{arxiv.1706.06905,
title = {Learnable pooling with Context Gating for video classification},
author = {Antoine Miech and Ivan Laptev and Josef Sivic},
journal= {arXiv preprint arXiv:1706.06905},
year = {2018}
}
备注
Presented at Youtube 8M CVPR17 Workshop. Kaggle Winning model. Under review for TPAMI