剖分三维卷积神经网络:用于高效在线视频处理的时序跳跃连接
计算机视觉与模式识别
2021-10-19 v2 机器学习
图像与视频处理
摘要
具有三维核的卷积神经网络(3D-CNNs)因其在视频帧内提取时空特征的优势,目前在视频识别任务中达到最先进结果。已有许多成功的三维卷积神经网络架构相继超越最先进结果。然而,它们几乎都被设计为离线运行,在在线操作时产生若干严重缺陷。首先,常规 3D-CNN 不是动态的,因为其输出特征表示整个输入片段而非片段中最近的帧。其次,由于其固有的时间下采样,它们不保持时间分辨率。最后,3D-CNN 被限制为使用固定的时间输入尺寸,限制了灵活性。为解决这些缺陷,我们提出剖分 3D-CNN,将网络的中间体沿深度(时间)维剖分并传播用于未来计算,大幅减少在线操作的计算量。对于动作分类,ResNet 模型的剖分版本在在线操作时计算量减少 77-90%,同时在 Kinetics-600 数据集上比常规 3D-ResNet 模型分类精度提高约 5%。此外,通过将我们的方法部署到多个视觉任务,证明了剖分 3D-CNN 的优势,其一致地提升了性能。
引用
@article{arxiv.2009.14639,
title = {Dissected 3D CNNs: Temporal Skip Connections for Efficient Online Video Processing},
author = {Okan Köpüklü and Stefan Hörmann and Fabian Herzog and Hakan Cevikalp and Gerhard Rigoll},
journal= {arXiv preprint arXiv:2009.14639},
year = {2021}
}