中文

利用 2:4 激活稀疏性加速 Transformer 推理与训练

机器学习 2025-03-24 v1 人工智能

摘要

在本文中,我们展示了如何利用 2:4 稀疏性——一种流行的硬件加速 GPU 稀疏模式——应用于激活以加速大语言模型的训练和推理。关键在于,我们利用平方 ReLU 激活中固有的稀疏性来提供这种加速,且不损失精度。我们的方法在前向和反向传播中均可将前馈网络 (FFN) 的速度提升高达 1.3 倍。本工作突显了稀疏性在加速大语言模型训练和推理中的关键作用。

关键词

引用

@article{arxiv.2503.16672,
  title  = {Accelerating Transformer Inference and Training with 2:4 Activation Sparsity},
  author = {Daniel Haziza and Timothy Chou and Dhruv Choudhary and Luca Wehrstedt and Francisco Massa and Jiecao Yu and Geonhwa Jeong and Supriya Rao and Patrick Labatut and Jesse Cai},
  journal= {arXiv preprint arXiv:2503.16672},
  year   = {2025}
}