FrameExit:用于高效视频识别的条件式早退框架
计算机视觉与模式识别
2021-04-29 v1 机器学习
摘要
本文提出一种用于高效视频识别的条件式早退框架。现有工作侧重于选择显著帧的子集以降低计算成本,而我们提出使用简单的采样策略结合条件式早退来实现高效识别。我们的模型自动学习对较简单视频处理更少帧、对复杂视频处理更多帧。为此,我们采用级联的门控模块来自动确定处理中推理已足够可靠的最早位置。我们向门控模块动态生成监督信号,以在精度与计算成本之间提供动态权衡。所提模型在三个大规模视频基准上优于对比方法。特别是在 ActivityNet1.3 和 mini-kinetics 上,我们以分别少 1.3 和 2.1 的 GFLOPs 优于最先进的高效视频识别方法。此外,我们的方法在 HVU 基准上确立了高效视频理解的新 state of the art。
引用
@article{arxiv.2104.13400,
title = {FrameExit: Conditional Early Exiting for Efficient Video Recognition},
author = {Amir Ghodrati and Babak Ehteshami Bejnordi and Amirhossein Habibian},
journal= {arXiv preprint arXiv:2104.13400},
year = {2021}
}
备注
CVPR 2021 | Oral paper