中文

CBinfer:利用帧间局部性加速视频流上卷积网络推理

计算机视觉与模式识别 2019-03-05 v2 人工智能 神经与进化计算 图像与视频处理

摘要

过去几年,基于深度神经网络构建与训练的新发现以及大型标注数据集的可用性,计算机视觉以惊人的速度取得了进展。将这些网络应用于图像需要很高的计算量,使得嵌入式平台难以将最先进网络用于实时视频数据。许多近期工作专注于降低网络复杂度以在嵌入式计算平台上进行实时推理。我们采用正交视角,提出一种利用像素变化的时空稀疏性的新算法。该优化推理过程在 Tegra X2 平台上针对语义分割应用相较 cuDNN 实现了平均 9.1 倍的加速,精度损失可忽略(<0.1%),且无需对网络重新训练。类似地,对于姿态检测 DNN 实现了平均 7.0 倍的加速,并且在静态摄像头视频监控数据的目标检测中将需执行的算术运算次数减少了 5 倍。这些吞吐增益结合更低的功耗,带来了 511 GOp/s/W 的能效,而基线仅为 70 GOp/s/W。

关键词

引用

@article{arxiv.1808.05488,
  title  = {CBinfer: Exploiting Frame-to-Frame Locality for Faster Convolutional Network Inference on Video Streams},
  author = {Lukas Cavigelli and Luca Benini},
  journal= {arXiv preprint arXiv:1808.05488},
  year   = {2019}
}

备注

arXiv admin note: substantial text overlap with arXiv:1704.04313