中文

具有结构化稀疏的动态稀疏训练

机器学习 2024-02-23 v4 计算机视觉与模式识别

摘要

动态稀疏训练(DST)方法在稀疏神经网络训练中取得了最先进的结果,在匹配稠密模型泛化能力的同时实现了稀疏训练与推理。尽管所得模型高度稀疏且在理论上计算开销更低,但在真实硬件上利用非结构化稀疏实现加速颇具挑战。在本工作中,我们提出一种稀疏到稀疏的 DST 方法,Structured RigL(SRigL),通过施加恒定扇入约束来学习一种细粒度结构化 N:M 稀疏的变体。利用我们对现有 DST 方法在高稀疏度下的实证分析,我们额外采用一种神经元消融方法,使 SRigL 在各种神经网络(NN)架构上实现最先进的稀疏到稀疏结构化 DST 性能。使用 90% 稀疏的线性层,我们展示了在 CPU 上在线推理实现 3.4x/2.5x 的真实加速,在 GPU 上批大小为 256 的推理实现 1.7x/13.0x 的加速,分别相对于等价的稠密/非结构化(CSR)稀疏层。

关键词

引用

@article{arxiv.2305.02299,
  title  = {Dynamic Sparse Training with Structured Sparsity},
  author = {Mike Lasby and Anna Golubeva and Utku Evci and Mihai Nica and Yani Ioannou},
  journal= {arXiv preprint arXiv:2305.02299},
  year   = {2024}
}

备注

ICLR 2024, 29 pages, 22 figures