中文

具有多尺度金字塔注意力与语义对抗网络的视频分类方法

计算机视觉与模式识别 2019-03-07 v1

摘要

双流架构在视频分类任务中展现出强劲性能。其关键思想是通过在空间和时间上融合卷积网络来学习时空特征。然而,此类架构存在一些问题。首先,它依赖光流来建模时间信息,而光流的计算与存储通常代价高昂。其次,其捕获视频数据细节与局部上下文信息的能力有限。第三,它缺乏显式的语义引导,这大幅降低了分类性能。本文中,我们提出了一种基于双流的新深度框架用于视频分类,仅从 RGB 帧中发现空间与时间信息;此外,引入了多尺度金字塔注意力(MPA)层与语义对抗学习(SAL)模块并集成到我们的框架中。MPA 使网络能够捕获全局与局部特征以生成视频的综合表示,而 SAL 能以对抗方式使该表示逐步逼近真实视频语义。在两个公开基准上的实验结果表明,我们提出的方法在标准视频数据集上取得了最先进的结果。

关键词

引用

@article{arxiv.1903.02155,
  title  = {Semantic Adversarial Network with Multi-scale Pyramid Attention for Video Classification},
  author = {De Xie and Cheng Deng and Hao Wang and Chao Li and Dapeng Tao},
  journal= {arXiv preprint arXiv:1903.02155},
  year   = {2019}
}