中文

面向GPU的层次性N:M稀疏的高效置换

机器学习 2024-07-31 v1 人工智能

摘要

N:M稀疏剪枝是一种强大的深度神经网络压缩技术,利用NVIDIA的稀疏张量核心技术。该方法因硬件对稀疏索引的支持,能够采用细粒度稀疏,以维持模型准确性,同时最小化通常与不规则数据访问相关的开销。虽然由于依赖硬件,N:M稀疏受限于固定稀疏度,但可以与较粗粒度稀疏技术结合,以实现多样化的压缩比。最初,对密集模型应用列向稀疏向量,然后在保存的列向量上进行行向N:M稀疏。我们将这种多级方法称为层次性N:M稀疏(HiNM稀疏)。类似于早期单级稀疏技术,HiNM稀疏需要有效的通道置换策略,以最大化压缩后网络的准确性。然而,它进一步复杂化了输入和输出通道的重新排列问题,涉及置换序列、HiNM稀疏感知置换以及跨层保持通道排序一致性等挑战。本文提出一种专为HiNM稀疏设计的通道置换方法,称为陀螺置换(gyro-permutation)。该方法旨在利用HiNM剪枝的独特特征,在每个置换阶段包含通道抽样、聚类和分配等策略,以规避局部最优值。此外,我们开发了一个GPU内核,支持HiNM稀疏网络执行期间的独立层置换。我们在各种深度神经网络模型上进行了大量实验评估,表明陀螺置换显著提升了HiNM稀疏网络的准确性,使其性能接近非结构化稀疏网络的水平。

关键词

引用

@article{arxiv.2407.20496,
  title  = {Toward Efficient Permutation for Hierarchical N:M Sparsity on GPUs},
  author = {Seungmin Yu and Xiaodie Yi and Hayun Lee and Dongkun Shin},
  journal= {arXiv preprint arXiv:2407.20496},
  year   = {2024}
}

备注

11 pages, 5 figures