面向深度学习的稀疏GPU核
机器学习
2020-09-02 v2 分布式、并行与集群计算
机器学习
摘要
科学工作负载传统上利用高度稀疏性来加速计算并减少内存需求。虽然深度神经网络可以被稀疏化,但在GPU上实现实际加速是困难的,因为这些应用具有相对中等的稀疏水平,不足以让现有稀疏核超越其稠密对应物。在这项工作中,我们研究来自深度学习应用的稀疏矩阵,并识别可利用以加速计算的有利特性。基于这些见解,我们为神经网络中广泛适用的两种稀疏矩阵运算开发了高性能GPU核:稀疏矩阵-稠密矩阵乘法和采样稠密-稠密矩阵乘法。我们的核在Nvidia V100 GPU上达到单精度峰值的27%。使用我们的核,我们展示了稀疏Transformer和MobileNet模型,在不损失精度的情况下实现了1.2-2.1倍加速和高达12.8倍的内存节省。
引用
@article{arxiv.2006.10901,
title = {Sparse GPU Kernels for Deep Learning},
author = {Trevor Gale and Matei Zaharia and Cliff Young and Erich Elsen},
journal= {arXiv preprint arXiv:2006.10901},
year = {2020}
}
备注
Updated to match camera-ready for SC20