中文

Turbo Sparse: 以最少的激活参数实现LLM的SOTA性能

机器学习 2024-06-12 v2 计算与语言

摘要

利用激活稀疏性是一种在不影响性能的前提下显著加速大型语言模型(LLM)推理过程的有前景的方法。然而,激活稀疏性由激活函数决定,而常用的激活函数如SwiGLU和GeGLU的稀疏性有限。简单地将这些函数替换为ReLU无法实现足够的稀疏性。此外,训练数据不足会进一步增加性能下降的风险。为应对这些挑战,我们提出了一种新颖的dReLU函数,旨在提高LLM的激活稀疏性,并配以高质量的训练数据混合比例以促进有效的稀疏化。此外,我们利用混合专家(MoE)模型中前馈网络(FFN)专家内部的稀疏激活模式来进一步提升效率。通过将我们的神经元稀疏化方法应用于Mistral和Mixtral模型,每次推理迭代仅激活25亿和43亿个参数,同时实现了更强大的模型性能。评估结果表明,这种稀疏性实现了2-5倍的解码加速。值得注意的是,在手机上,我们的TurboSparse-Mixtral-47B实现了每秒11个token的推理速度。我们的模型可在\url{https://huggingface.co/PowerInfer}获取。

关键词

引用

@article{arxiv.2406.05955,
  title  = {Turbo Sparse: Achieving LLM SOTA Performance with Minimal Activated Parameters},
  author = {Yixin Song and Haotong Xie and Zhengyan Zhang and Bo Wen and Li Ma and Zeyu Mi and Haibo Chen},
  journal= {arXiv preprint arXiv:2406.05955},
  year   = {2024}
}