向 2:4 稀疏性及更高:面向加速 LLM 预训练的神经元级激活函数
机器学习
2026-02-09 v1
摘要
大语言模型的训练通常受矩阵乘法的瓶颈限制。在 Transformer 架构中,这些运算的大部分发生在前馈网络(FFN)中,且随着模型规模的增大,这一比例可达总运算量的最高 50%。我们表明,可以利用硬件加速稀疏性来加速 FFN 中的所有矩阵乘法,采用 2:4 稀疏性处理权重,采用 v:n:m(Venom)稀疏性处理激活值。我们的做法依赖稀疏训练步骤来加速大规模预训练的一部分,同时在最后采用常规稠密训练步骤。总体而言,采用该方法训练的模型在我们的质量基准测试中表现相同,可实现端到端加速 1.4 至 1.7 倍。该方法适用于从 A100 代开始的 NVIDIA 所有 GPU,与常见的优化技术(如量化)是正交的,也可应用于 mixture-of-experts 模型架构。
引用
@article{arxiv.2602.06183,
title = {To 2:4 Sparsity and Beyond: Neuron-level Activation Function to Accelerate LLM Pre-Training},
author = {Meghana Madhyastha and Daniel Haziza and Jesse Cai and Newsha Ardalani and Zhiqi Bu and Carole-Jean Wu},
journal= {arXiv preprint arXiv:2602.06183},
year = {2026}
}