用于视频实时处理的持续型三维卷积神经网络
计算机视觉与模式识别
2023-01-25 v3 机器学习
摘要
我们提出了持续型三维卷积神经网络(Co3D CNNs),这是一种时空三维CNN的新计算形式,其中视频以逐帧而非片段的方式处理。在需要逐帧预测的在线任务中,Co3D CNNs消除了常规三维CNN的计算冗余,即出现在重叠片段中对帧的重复卷积。我们表明,持续型三维CNN可以复用已有的3D-CNN权重,以与时空感受野成比例地减少每次预测的浮点运算次数(FLOPs),同时保持相似的内存需求和精度。这在Kinetics-400和Charades上使用多个模型得到了验证,结果显著:与常规X3D模型相比,CoX3D模型在Kinetics-400上达到了最先进的复杂度/精度权衡,FLOPs降低12.1-15.3倍,精度提升2.3-3.8%,同时峰值内存消耗降低高达48%。此外,我们研究了Co3D CNNs在启动时的瞬态响应,并对公开可用的3D CNN进行了广泛的硬件上处理特性基准测试。
引用
@article{arxiv.2106.00050,
title = {Continual 3D Convolutional Neural Networks for Real-time Processing of Videos},
author = {Lukas Hedegaard and Alexandros Iosifidis},
journal= {arXiv preprint arXiv:2106.00050},
year = {2023}
}
备注
22 pages, 9 figures, 7 tables