中文

压缩视频中的快速目标检测

计算机视觉与模式识别 2019-08-20 v3

摘要

视频中的目标检测因在真实场景中更实用而受到越来越多的关注。大多数深度学习方法使用CNN逐帧独立处理视频流中每个已解码帧。然而,视频压缩格式中已嵌入的免费却有价值的运动信息通常被忽视。本文中,我们利用这一点提出了一种快速目标检测方法,采用新颖的运动辅助记忆网络(Motion aided Memory Network, MMNet)。MMNet有两大优势:1) 它显著加速了压缩视频的特征提取过程。仅需对I帧(即视频中少数参考帧)运行完整的识别网络,并以轻量记忆网络快速生成后续P帧(预测帧)的特征;2) 与现有建立额外网络建模帧运动的方法不同,我们充分利用视频流中免费可得的运动向量与残差误差。据我们所知,MMNet是首个在压缩视频上研究深度卷积检测器的工作。我们的方法在大规模ImageNet VID数据集上评估,结果表明其比单图像检测器R-FCN快3倍,比高性能检测器MANet快10倍,且精度损失微小。

关键词

引用

@article{arxiv.1811.11057,
  title  = {Fast Object Detection in Compressed Video},
  author = {Shiyao Wang and Hongchao Lu and Zhidong Deng},
  journal= {arXiv preprint arXiv:1811.11057},
  year   = {2019}
}

备注

10 pages, 7 figures and 2 tables