中文

用于视频实时处理的持续型三维卷积神经网络

计算机视觉与模式识别 2023-01-25 v3 机器学习

摘要

我们提出了持续型三维卷积神经网络(Co3D CNNs),这是一种时空三维CNN的新计算形式,其中视频以逐帧而非片段的方式处理。在需要逐帧预测的在线任务中,Co3D CNNs消除了常规三维CNN的计算冗余,即出现在重叠片段中对帧的重复卷积。我们表明,持续型三维CNN可以复用已有的3D-CNN权重,以与时空感受野成比例地减少每次预测的浮点运算次数(FLOPs),同时保持相似的内存需求和精度。这在Kinetics-400和Charades上使用多个模型得到了验证,结果显著:与常规X3D模型相比,CoX3D模型在Kinetics-400上达到了最先进的复杂度/精度权衡,FLOPs降低12.1-15.3倍,精度提升2.3-3.8%,同时峰值内存消耗降低高达48%。此外,我们研究了Co3D CNNs在启动时的瞬态响应,并对公开可用的3D CNN进行了广泛的硬件上处理特性基准测试。

关键词

引用

@article{arxiv.2106.00050,
  title  = {Continual 3D Convolutional Neural Networks for Real-time Processing of Videos},
  author = {Lukas Hedegaard and Alexandros Iosifidis},
  journal= {arXiv preprint arXiv:2106.00050},
  year   = {2023}
}

备注

22 pages, 9 figures, 7 tables