利用高效非结构化剪枝与位宽缩减在GPU上加速深度学习模型
机器学习
2022-08-30 v2 人工智能
性能
摘要
这项工作聚焦于一些卷积神经网络(CNNs)的剪枝,并通过使用直接稀疏算法提升其在图形处理单元(GPU)上的效率。Nvidia深度神经网络(cuDnn)库是针对GPU的深度学习(DL)算法最有效的实现。GPU是深度学习计算中最常用的加速器。提升CNN模型效率的最常见技术之一是权重剪枝和量化。剪枝主要有两类:结构化和非结构化。第一类在许多类型的加速器上更容易加速,但难以达到第二类所能获得的高稀疏度和高准确率。带重训练的非结构化剪枝可在某些深度CNN模型中生成高达90%或更高稀疏度的权重张量。本文提出了一种剪枝算法,可在不损失准确率的情况下实现高稀疏度。在下一阶段,采用线性和非线性量化以进一步减少时间和占用空间。本文是先前发表的关于有效剪枝技术论文的扩展,展示了具有高空疏率和降低精度的真实剪枝模型,其能取得优于CuDnn库的性能。
引用
@article{arxiv.2112.15445,
title = {Speedup deep learning models on GPU by taking advantage of efficient unstructured pruning and bit-width reduction},
author = {Marcin Pietroń and Dominik Żurek},
journal= {arXiv preprint arXiv:2112.15445},
year = {2022}
}
备注
arXiv admin note: substantial text overlap with arXiv:2011.06295