大语言模型中的免训练激活稀疏性
计算与语言
2025-02-27 v3 人工智能
摘要
激活稀疏性可以通过减少前向传播过程中矩阵乘法所需的计算和内存移动,从而在大语言模型中实现实际的推理加速。然而,现有方法存在限制其广泛采用的局限性。一些方法针对基于ReLU的稀疏性的旧模型,而其他方法需要对多达数千亿个token进行大量的持续预训练。本文描述了TEAL,一种简单的免训练方法,它将基于幅度的激活稀疏性应用于整个模型中的隐藏状态。TEAL在Llama-2、Llama-3和Mistral系列模型(大小从7B到70B不等)上实现了40-50%的模型级稀疏性,且性能下降极小。我们改进了现有的稀疏内核,并在40%和50%的模型级稀疏性下,分别展示了高达1.53倍和1.8倍的实际解码加速。TEAL与权重量化兼容,可实现进一步的效率提升。
引用
@article{arxiv.2408.14690,
title = {Training-Free Activation Sparsity in Large Language Models},
author = {James Liu and Pragaash Ponnusamy and Tianle Cai and Han Guo and Yoon Kim and Ben Athiwaratkun},
journal= {arXiv preprint arXiv:2408.14690},
year = {2025}
}
备注
Rev. 2: ICLR 2025 Acceptance (Spotlight)