中文

面向 GPU 高效 DNN 推理的平衡稀疏性

计算机视觉与模式识别 2020-10-30 v4

摘要

在训练好的深度神经网络中,非结构化剪枝可减少冗余权重以降低存储成本。然而,它需要定制硬件来加速实际推理。另一趋势是通过采用粗粒度稀疏性来剪枝或正则化连续权重以实现高效计算,从而在通用硬件上加速稀疏模型推理。但该方法常牺牲模型精度。本文提出一种新颖的细粒度稀疏性方法——平衡稀疏性,以在商用硬件上高效地实现高模型精度。我们的方法适应了 GPU 的高并行性,在深度学习的广泛部署中展现出稀疏性的巨大潜力。实验结果表明,平衡稀疏性在 GPU 上实现了高达 3.1 倍的实际推理加速,同时保持了与细粒度稀疏性相同的高模型精度。

关键词

引用

@article{arxiv.1811.00206,
  title  = {Balanced Sparsity for Efficient DNN Inference on GPU},
  author = {Zhuliang Yao and Shijie Cao and Wencong Xiao and Chen Zhang and Lanshun Nie},
  journal= {arXiv preprint arXiv:1811.00206},
  year   = {2020}
}