中文

ProSparse:在大语言模型中引入并增强内在激活稀疏性

机器学习 2025-01-08 v7 人工智能 计算与语言

摘要

激活稀疏性指的是在激活输出中存在大量弱贡献元素。作为采用 ReLU 激活函数的模型的常见属性,激活稀疏性已被证明是提高模型推理效率的有前景的范例。然而,大多数大语言模型(LLM)采用的是无内在激活稀疏性的激活函数(如 GELU 和 Swish)。最近的一些研究探索了将 ReLU 或其变体作为替代激活函数,以帮助 LLM 实现激活稀疏性和推理加速,但很少能同时获得高稀疏度和可比的模型性能。本文介绍一种简单且有效的稀疏化方法,称为"ProSparse",以在保持可比性能的同时推动 LLM 实现更高的激活稀疏度。具体而言,在将 LLM 的激活函数替换为 ReLU 后,ProSparse 采用沿多阶段正弦曲线平滑递增的比例稀疏正则化。这可以增强激活稀疏度并通过避免激活分布的激进性变化来缓解性能退化。通过 ProSparse,我们获得了 LLaMA2-7B 为 89.32%、LLaMA2-13B 为 88.80%、以及 MiniCPM-1B 为 87.89% 的高稀疏度,实现了与其原始采用 Swish 激活版本的可比性能。这类稀疏激活模型目前是开源 LLaMA 版本中稀疏度最高的,也是表现优异的端大小模型,显著优于 ReluLLaMA-7B(66.98%)和 ReluLLaMA-13B(71.56%)。我们的推理加速实验进一步表明,具有更高激活稀疏度的 LLM 具有显著的实际加速潜力,最高可实现 4.52 倍的推理加速。

关键词

引用

@article{arxiv.2402.13516,
  title  = {ProSparse: Introducing and Enhancing Intrinsic Activation Sparsity within Large Language Models},
  author = {Chenyang Song and Xu Han and Zhengyan Zhang and Shengding Hu and Xiyu Shi and Kuai Li and Chen Chen and Zhiyuan Liu and Guangli Li and Tao Yang and Maosong Sun},
  journal= {arXiv preprint arXiv:2402.13516},
  year   = {2025}
}

备注

19 pages, 4 figures, 9 tables