利用 2:4 激活稀疏性加速 Transformer 推理与训练
机器学习
2025-03-24 v1 人工智能
摘要
在本文中,我们展示了如何利用 2:4 稀疏性——一种流行的硬件加速 GPU 稀疏模式——应用于激活以加速大语言模型的训练和推理。关键在于,我们利用平方 ReLU 激活中固有的稀疏性来提供这种加速,且不损失精度。我们的方法在前向和反向传播中均可将前馈网络 (FFN) 的速度提升高达 1.3 倍。本工作突显了稀疏性在加速大语言模型训练和推理中的关键作用。
引用
@article{arxiv.2503.16672,
title = {Accelerating Transformer Inference and Training with 2:4 Activation Sparsity},
author = {Daniel Haziza and Timothy Chou and Dhruv Choudhary and Luca Wehrstedt and Francisco Massa and Jiecao Yu and Geonhwa Jeong and Supriya Rao and Patrick Labatut and Jesse Cai},
journal= {arXiv preprint arXiv:2503.16672},
year = {2025}
}