资源高效的3D卷积神经网络
计算机视觉与模式识别
2021-10-19 v5
摘要
近来,具有3D核的卷积神经网络(3D CNNs)在计算机视觉界非常流行,因为与2D CNNs相比,它们在提取视频帧内时空特征方面具有更优的能力。尽管近期在考虑内存和功耗预算下构建资源高效的2D CNN架构方面取得了巨大进展,但几乎没有任何类似的资源高效的3D CNN架构。在本文中,我们将各种知名的资源高效2D CNN转换为3D CNN,并在三个主要基准上针对不同复杂度级别的分类准确率评估了它们的性能。我们在(1)Kinetics-600数据集上检验了它们的学习能力,(2)Jester数据集上检验了它们捕捉运动模式的能力,以及(3)UCF-101上检验了迁移学习的适用性。我们在单个Titan XP GPU和Jetson TX2嵌入式系统上评估了每个模型的运行时间性能。本研究结果表明,这些模型可用于不同类型的现实世界应用,因为它们以可观的准确率和内存占用提供了实时性能。我们对不同复杂度级别的分析表明,为了节省复杂度,资源高效的3D CNN不应设计得过于浅或窄。本工作中使用的代码和预训练模型已公开可用。
引用
@article{arxiv.1904.02422,
title = {Resource Efficient 3D Convolutional Neural Networks},
author = {Okan Köpüklü and Neslihan Kose and Ahmet Gunduz and Gerhard Rigoll},
journal= {arXiv preprint arXiv:1904.02422},
year = {2021}
}
备注
Accepted to ICCV 2019 workshop - Neural Architects