中文

FASTER:用于高效视频分类的循环网络

计算机视觉与模式识别 2019-09-10 v2

摘要

典型的视频分类方法通常将视频划分为短片段,独立地对每个片段进行推理,然后聚合片段级预测以生成视频级结果。然而,独立处理视觉相似的片段忽略了视频序列的时间结构,并增加了推理时的计算成本。本文提出一个名为 FASTER 的新框架,即时空冗余的特征聚合(Feature Aggregation for Spatio-TEmporal Redundancy)。FASTER 旨在利用相邻片段之间的冗余,并通过学习聚合来自不同复杂度模型的预测来降低计算成本。FASTER 框架能够整合来自昂贵模型的高质量表征以捕捉细微运动信息,以及来自轻量模型的轻量表征以覆盖视频中的场景变化。设计了一种新的循环网络(即 FAST-GRU)来聚合不同表征的混合物。与现有方法相比,FASTER 能在 Kinetics、UCF-101 和 HMDB-51 等流行数据集上保持最先进准确率的同时,将 FLOPs 降低超过 10 倍。

关键词

引用

@article{arxiv.1906.04226,
  title  = {FASTER Recurrent Networks for Efficient Video Classification},
  author = {Linchao Zhu and Laura Sevilla-Lara and Du Tran and Matt Feiszli and Yi Yang and Heng Wang},
  journal= {arXiv preprint arXiv:1906.04226},
  year   = {2019}
}