中文

基于时空注意力与双流协同学习的视频分类方法

计算机视觉与模式识别 2017-11-10 v1

摘要

视频分类具有高度重要性及广泛应用,如视频搜索与智能监控。视频天然由静态信息与运动信息组成,可分别由帧与光流表示。近来,研究者通常采用深度网络\emph{分别}捕获静态与运动信息,这主要有两点局限:(1) 忽视空间注意力与时间注意力之间的共存关系,而它们应作为视频的时空演化被联合建模,从而可提取具有判别力的视频特征;(2) 忽视视频中并存的静态与运动信息之间的强互补性,而它们应被协同学习以相互促进。为应对上述两点局限,本文提出具有时空注意力的双流协同学习(TCLSTA)方法,其包含两个模型:(1) 时空注意力模型:空间级注意力强调帧中的显著区域,时间级注意力挖掘视频中的判别性帧。它们被联合学习并相互提升,以学习判别性的静态与运动特征,从而获得更好的分类性能。(2) 静态-运动协同模型:它不仅在静态与运动信息上实现相互引导以促进特征学习,还自适应地学习静态流与运动流的融合权重,从而利用静态与运动信息间的强互补性来提升视频分类。在4个广泛使用的数据集上的实验表明,我们的 TCLSTA 方法相较10余种最先进方法取得了最佳性能。

关键词

引用

@article{arxiv.1711.03273,
  title  = {Two-stream Collaborative Learning with Spatial-Temporal Attention for Video Classification},
  author = {Yuxin Peng and Yunzhen Zhao and Junchao Zhang},
  journal= {arXiv preprint arXiv:1711.03273},
  year   = {2017}
}

备注

14 pages, accepted by IEEE Transactions on Circuits and Systems for Video Technology