中文

Escoin: GPU 上高效的稀疏卷积神经网络推理

分布式、并行与集群计算 2019-04-05 v2 计算机视觉与模式识别 机器学习

摘要

深度神经网络在许多人工智能应用(例如计算机视觉)中取得了显著的准确率,但代价是大量的参数和高计算复杂度。权重剪枝可以通过移除网络中的冗余参数来压缩 DNN 模型,但这带来了权重矩阵的稀疏性,从而使得在 GPU 上的计算效率低下。尽管剪枝可以移除超过 80% 的权重,但在 GPU 上运行模型时实际上损害了推理性能(速度)。两个主要问题导致了 GPU 上这种不尽人意的表现。首先,将卷积降为矩阵乘法减少了数据重用机会并浪费了内存带宽。其次,剪枝带来的稀疏性使得计算不规则,从而在大规模并行 GPU 上运行时导致低效。为克服这两个局限,我们提出了 Escort,一种 GPU 上高效的稀疏卷积神经网络。我们没有使用降维方法,而是选择直接计算稀疏卷积。随后我们为直接稀疏卷积核编排了并行性与局部性,并应用定制优化技术进一步提升性能。在 NVIDIA GPU 上的评估表明,与 CUBLAS 和 CUSPARSE 相比,Escort 分别将稀疏卷积速度提升了 2.63 倍和 3.07 倍,推理速度提升了 1.43 倍和 1.69 倍。

关键词

引用

@article{arxiv.1802.10280,
  title  = {Escoin: Efficient Sparse Convolutional Neural Network Inference on GPUs},
  author = {Xuhao Chen},
  journal= {arXiv preprint arXiv:1802.10280},
  year   = {2019}
}