FASTER:用于高效视频分类的循环网络
计算机视觉与模式识别
2019-09-10 v2
摘要
典型的视频分类方法通常将视频划分为短片段,独立地对每个片段进行推理,然后聚合片段级预测以生成视频级结果。然而,独立处理视觉相似的片段忽略了视频序列的时间结构,并增加了推理时的计算成本。本文提出一个名为 FASTER 的新框架,即时空冗余的特征聚合(Feature Aggregation for Spatio-TEmporal Redundancy)。FASTER 旨在利用相邻片段之间的冗余,并通过学习聚合来自不同复杂度模型的预测来降低计算成本。FASTER 框架能够整合来自昂贵模型的高质量表征以捕捉细微运动信息,以及来自轻量模型的轻量表征以覆盖视频中的场景变化。设计了一种新的循环网络(即 FAST-GRU)来聚合不同表征的混合物。与现有方法相比,FASTER 能在 Kinetics、UCF-101 和 HMDB-51 等流行数据集上保持最先进准确率的同时,将 FLOPs 降低超过 10 倍。
引用
@article{arxiv.1906.04226,
title = {FASTER Recurrent Networks for Efficient Video Classification},
author = {Linchao Zhu and Laura Sevilla-Lara and Du Tran and Matt Feiszli and Yi Yang and Heng Wang},
journal= {arXiv preprint arXiv:1906.04226},
year = {2019}
}