D3D:用于视频动作识别的蒸馏三维网络
计算机视觉与模式识别
2019-02-07 v2
摘要
视频动作识别的最先进方法通常使用两个网络的集成:以 RGB 帧作为输入的空间流,以及以光流作为输入的时序流。在近期工作中,这两个流均由三维卷积神经网络组成,后者在对视频片段进行分类之前施加时空滤波器。从概念上讲,时序滤波器应使空间流能够学习运动表征,从而使时序流冗余。然而,我们通过引入一个完全独立的时序流仍观察到动作识别性能的显著提升,这表明空间流“缺失”了时序流所捕获的部分信号。在这项工作中,我们首先研究三维 CNN 的空间流中是否确实缺失运动表征。其次,我们证明这些运动表征可通过蒸馏加以改进,即通过调整空间流以预测时序流的输出,从而将两个模型有效合并为单一流。最后,我们展示了我们的蒸馏三维网络(D3D)在仅使用单一模型且无需计算光流的情况下,达到了与双流方法相当的性能。
引用
@article{arxiv.1812.08249,
title = {D3D: Distilled 3D Networks for Video Action Recognition},
author = {Jonathan C. Stroud and David A. Ross and Chen Sun and Jia Deng and Rahul Sukthankar},
journal= {arXiv preprint arXiv:1812.08249},
year = {2019}
}
备注
Added link to code and models at https://www.jonathancstroud.com/d3d