中文

用于视频快速推断的循环残差模块

计算机视觉与模式识别 2018-02-28 v1

摘要

深度卷积神经网络(CNNs)在许多视频识别任务(如视频姿态估计和视频目标检测)中取得了令人印象深刻的进展。然而,由于逐帧处理密集帧,视频上的 CNN 推断在计算上十分昂贵。在这项工作中,我们提出一种称为循环残差模块(RRM)的框架,以加速视频识别任务的 CNN 推断。该框架新颖地利用两连续帧中间特征图的相似性,大幅减少冗余计算。与先前工作相比,所提方法的一个独特性质是每帧的特征图都被精确计算。实验表明,在保持相似识别性能的同时,我们的 RRM 在常用 CNN(如 AlexNet、ResNet、深度压缩模型(因此比使用高效推断引擎的原始稠密模型快 8-12 倍))上平均实现 2 倍加速,并在一些二值网络(如 XNOR-Nets)上令人印象深刻地实现 9 倍加速(因此比原始模型快 500 倍)。我们进一步验证了 RRM 在加速视频姿态估计和视频目标检测的 CNN 方面的有效性。

关键词

引用

@article{arxiv.1802.09723,
  title  = {Recurrent Residual Module for Fast Inference in Videos},
  author = {Bowen Pan and Wuwei Lin and Xiaolin Fang and Chaoqin Huang and Bolei Zhou and Cewu Lu},
  journal= {arXiv preprint arXiv:1802.09723},
  year   = {2018}
}

备注

To appear in CVPR 2018