中文

基于增强运动向量CNN的实时动作识别

计算机视觉与模式识别 2016-04-27 v1

摘要

深度双流架构在基于视频的动作识别上展现了优异性能。该方法中计算量最大的步骤来自光流的计算,这阻碍了其实时性。本文通过用运动向量替换光流来加速该架构,运动向量可直接从压缩视频中获得而无需额外计算。然而,运动向量缺乏精细结构,并包含噪声和不准确的运动模式,导致识别性能明显下降。我们缓解此问题的关键见解是光流与运动向量具有内在相关性。将使用光流CNN学习到的知识迁移到运动向量CNN可以显著提升后者的性能。具体地,我们引入了三种策略:初始化迁移、监督迁移及其组合。实验结果表明,我们的方法取得了与SOTA相当的识别性能,同时我们的方法可以处理390.7帧每秒,比原始双流方法快27倍。

关键词

引用

@article{arxiv.1604.07669,
  title  = {Real-time Action Recognition with Enhanced Motion Vector CNNs},
  author = {Bowen Zhang and Limin Wang and Zhe Wang and Yu Qiao and Hanli Wang},
  journal= {arXiv preprint arXiv:1604.07669},
  year   = {2016}
}

备注

accepted by CVPR16