对角稀疏网络的动态稀疏训练
机器学习
2025-06-16 v1
摘要
动态稀疏训练(DST)的最新进展推动了稀疏神经网络训练在结构化和非结构化语境下的前沿,在匹配密集模型性能的同时大幅减少参数数量以促进模型扩展。然而,非结构化稀疏通常无法在现代硬件上转化为实际加速。为解决这一不足,本文提出了 DynaDiag,一种新颖的结构化稀疏到结构化稀疏 DST 方法,其性能与非结构化稀疏相当。DynaDiag 在训练过程中强制对角稀疏模式,并在前向和后向传播中保持稀疏计算。我们进一步利用对角结构通过自定义 CUDA 内核加速计算,使该方法对硬件友好。在多种神经网络架构上的实证评估表明,该方法在保持与非结构化方法相当的准确性的同时,受益于显著的计算增益。特别地,在 ViT 中使用 90% 稀疏线性层时,在线推理速度提升了高达 3.13 倍,且未牺牲模型性能,在 GPU 上训练速度提升了 1.59 倍。源代码可在 https://github.com/horizon-research/DynaDiag/ 获取。
引用
@article{arxiv.2506.11449,
title = {Dynamic Sparse Training of Diagonally Sparse Networks},
author = {Abhishek Tyagi and Arjun Iyer and William H Renninger and Christopher Kanan and Yuhao Zhu},
journal= {arXiv preprint arXiv:2506.11449},
year = {2025}
}