GPU上的深度学习模型何时可利用非结构化稀疏性实现加速
机器学习
2022-01-03 v2 机器学习
摘要
本文聚焦于提升图形处理单元(GPU)上稀疏卷积神经网络(CNN)层的效率。Nvidia深度神经网络(cuDnn)库为GPU提供了最有效的深度学习(DL)算法实现。GPU是深度学习计算中最高效且常用的加速器之一。现代CNN模型需要数兆字节的系数并执行数百万次MAC运算以完成卷积。压缩CNN模型最常见的技术之一是权重剪枝。剪枝主要有两类:结构化(基于移除整个权重通道)与非结构化(移除单个权重)。前者更易加速,但难以达到后者所能获得的高稀疏度与准确率。带重训练的非结构化剪枝可在某些深度CNN模型中生成稀疏度达或更高的矩阵权重。本工作展示了何时值得使用直接稀疏运算来加速卷积层计算。以VGG-16、CNN-non-static以及ResNet模型中的1x1层作为基准。此外,我们给出了使用降低精度对时间效率的影响。
引用
@article{arxiv.2011.06295,
title = {When deep learning models on GPU can be accelerated by taking advantage of unstructured sparsity},
author = {Marcin Pietroń and Dominik Żurek},
journal= {arXiv preprint arXiv:2011.06295},
year = {2022}
}