中文

基于部分线性前馆网络的大型语言模型加速

机器学习 2025-01-31 v1 人工智能

摘要

大型语言模型(LLM)展现出惊人的能力,但因参数规模巨大在部署时面临挑战。虽然现有压缩技术如剪枝可减少模型规模,但在高压缩比下会导致显著的精度下降。我们提出一种新颖的视角,灵感来自编译优化中的常量折叠。我们的做法通过将LLM中的激活函数视为线性函数来实现参数降低。然而,近期的LLM使用复杂的非线性激活函数(如GELU),阻碍了该技术的直接应用。我们提出TARDIS,通过在频繁出现的输入范围内对非线性函数进行部分线性近似来实现优化。对于异常输入,TARDIS采用在线预测器动态回退到原始计算。我们的实验表明,TARDIS在前馆网络中实现了80%的参数降低,显著优于最新的剪枝方法Wanda和RIA,准确率提升最高可达65%。在7B模型的实际部署中,TARDIS集成vLLM服务系统时实现1.6倍的端到端推理加速,集成广泛采用的HuggingFace实现时实现1.4倍加速,仅以10.9%的精度代价。

关键词

引用

@article{arxiv.2501.10054,
  title  = {Accelerating Large Language Models through Partially Linear Feed-Forward Network},
  author = {Gansen Hu and Zhaoguo Wang and Jinglin Wei and Wei Huang and Haibo Chen},
  journal= {arXiv preprint arXiv:2501.10054},
  year   = {2025}
}