中文

渐进梯度流:Transformer中鲁棒的N:M稀疏性训练

机器学习 2024-02-08 v1 硬件体系结构

摘要

N:M结构化稀疏性因其相对适中的开销和更高的效率而引起了广泛关注。此外,这种稀疏性形式因其表示开销较小,在减少内存占用方面具有相当大的吸引力。已有一些工作致力于开发N:M结构化稀疏性的训练方法,但它们主要关注低稀疏区域(约50%)。然而,使用这些方法训练的模型在面对高稀疏区域(>80%)时性能往往会下降。在这项工作中,我们研究了现有稀疏训练方法在\textit{高稀疏区域}的有效性,并认为这些方法无法维持与低稀疏区域相当的模型质量。我们证明,导致这种差异的重要因素是梯度幅度中存在较高水平的诱导噪声。为了减轻这种不良影响,我们采用衰减机制来逐步限制梯度流向被剪枝的元素。我们的方法在高稀疏区域下,视觉模型和语言模型的模型质量分别提升了高达2%和5%。我们还评估了模型精度与训练计算成本(以FLOPs计)之间的权衡。在等训练FLOPs条件下,我们的方法相比传统稀疏训练方法取得了更好的性能,精度提升高达2%。源代码可在https://github.com/abhibambhaniya/progressive_gradient_flow_nm_sparsity获取。

关键词

引用

@article{arxiv.2402.04744,
  title  = {Progressive Gradient Flow for Robust N:M Sparsity Training in Transformers},
  author = {Abhimanyu Rajeshkumar Bambhaniya and Amir Yazdanbakhsh and Suvinay Subramanian and Sheng-Chun Kao and Shivani Agrawal and Utku Evci and Tushar Krishna},
  journal= {arXiv preprint arXiv:2402.04744},
  year   = {2024}
}

备注

18 pages, 8 figures, 17 tables. Code is available at https://github.com/abhibambhaniya/progressive_gradient_flow_nm_sparsity