中文

模仿原始域:加速压缩域中的动作识别

计算机视觉与模式识别 2020-04-23 v3

摘要

视频理解通常需要昂贵的计算开销,阻碍了其部署,然而视频包含可加以利用的显著时空冗余。特别地,直接在压缩视频域中的运动向量与残差上操作,可显著加速计算,因为无需使用需要巨大存储容量的原始视频。现有方法将这一任务视为多模态问题。本文以完全不同的方式处理该任务;我们将压缩流中的数据视为一个单元片段,并提出残差帧可替代原始域中的原始 RGB 帧。此外,我们使用师生方法辅助压缩域中的网络去模仿原始域中的教师网络。我们在三个领先的数据集(HMDB51、UCF1 和 Kinetics)上展示了实验,通过使用压缩数据达到了原始视频数据上的最先进精度。我们的模型 MFCD-Net 在压缩域中优于先前的方法,更重要的是,我们的模型参数减少 11 倍、Flops 减少 3 倍,显著提升了视频识别推理的效率。该方法使得仅需在压缩域中应用神经网络,在不牺牲精度的同时加速性能。

关键词

引用

@article{arxiv.1911.08206,
  title  = {Mimic The Raw Domain: Accelerating Action Recognition in the Compressed Domain},
  author = {Barak Battash and Haim Barad and Hanlin Tang and Amit Bleiweiss},
  journal= {arXiv preprint arXiv:1911.08206},
  year   = {2020}
}

备注

CVPR 2020: Joint Workshop on Efficient Deep Learning in Computer Vision