中文

注意力簇:基于纯注意力的视频分类局部特征整合

计算机视觉与模式识别 2017-11-28 v1 机器学习

摘要

近来,大量研究工作聚焦于如何应用 CNN 或 RNN 以更好地从视频中提取时间模式,从而提升视频分类准确率。然而,本文中我们表明,在时间信息——尤其是长期模式——对于在常见视频分类数据集上取得有竞争力结果而言可能并非必要。我们探究了基于纯注意力的局部特征整合的潜力。考虑到此类特征在视频分类中的特性,我们提出了一种基于注意力簇的局部特征整合框架,并引入移位操作以捕获更多样化的信号。我们细致地分析并比较了不同注意力机制、簇大小以及移位操作使用的效果,还研究了注意力簇用于多模态整合的组合方式。我们在三个真实世界视频分类数据集上展示了框架的有效性。我们的模型在所有这些数据集上均取得了有竞争力的结果。特别是在大规模 Kinetics 数据集上,我们的框架在验证集上以 top-1 准确率 79.4% 与 top-5 准确率 94.0% 取得了优异的单模型精度。注意力簇是我们于 ActivityNet Kinetics Challenge 2017 夺冠方案的主干。代码与模型将很快发布。

关键词

引用

@article{arxiv.1711.09550,
  title  = {Attention Clusters: Purely Attention Based Local Feature Integration for Video Classification},
  author = {Xiang Long and Chuang Gan and Gerard de Melo and Jiajun Wu and Xiao Liu and Shilei Wen},
  journal= {arXiv preprint arXiv:1711.09550},
  year   = {2017}
}

备注

The backbone of the winner solution at ActivityNet Kinetics Challenge 2017