中文

面向深度学习的稀疏GPU核

机器学习 2020-09-02 v2 分布式、并行与集群计算 机器学习

摘要

科学工作负载传统上利用高度稀疏性来加速计算并减少内存需求。虽然深度神经网络可以被稀疏化,但在GPU上实现实际加速是困难的,因为这些应用具有相对中等的稀疏水平,不足以让现有稀疏核超越其稠密对应物。在这项工作中,我们研究来自深度学习应用的稀疏矩阵,并识别可利用以加速计算的有利特性。基于这些见解,我们为神经网络中广泛适用的两种稀疏矩阵运算开发了高性能GPU核:稀疏矩阵-稠密矩阵乘法和采样稠密-稠密矩阵乘法。我们的核在Nvidia V100 GPU上达到单精度峰值的27%。使用我们的核,我们展示了稀疏Transformer和MobileNet模型,在不损失精度的情况下实现了1.2-2.1倍加速和高达12.8倍的内存节省。

关键词

引用

@article{arxiv.2006.10901,
  title  = {Sparse GPU Kernels for Deep Learning},
  author = {Trevor Gale and Matei Zaharia and Cliff Young and Erich Elsen},
  journal= {arXiv preprint arXiv:2006.10901},
  year   = {2020}
}

备注

Updated to match camera-ready for SC20