中文

LoRAP:大型语言模型的 Transformer 子层需要差异化结构化压缩

机器学习 2024-04-16 v1 人工智能 计算与语言

摘要

大型语言模型(LLM)在困难任务中表现出色,但通常需要大量内存和计算资源。如何减少 LLM 的参数规模已成为研究热点。在本研究中,我们观察到 Transformer 的多头自注意力(MHA)子层表现出明显的低秩结构,而前馈网络(FFN)子层则不然。鉴于此,我们设计了一种混合压缩模型,将低秩矩阵近似与结构化剪枝有机结合。对于 MHA 子层,我们提出了一种输入激活加权奇异值分解方法来增强低秩特性。此外,我们发现 MHA 子层中的权重矩阵具有不同的低秩程度。因此,设计了一种根据低秩程度差异的新型参数分配方案。对于 FFN 子层,我们提出了一种无梯度结构化通道剪枝方法。在剪枝过程中,我们得到一个有趣的发现:最不重要的 1% 参数实际上在模型性能中起着至关重要的作用。对零样本困惑度和零样本任务分类的广泛评估表明,在多种压缩比下,我们的方案优于以往的结构化压缩方法。

关键词

引用

@article{arxiv.2404.09695,
  title  = {LoRAP: Transformer Sub-Layers Deserve Differentiated Structured Compression for Large Language Models},
  author = {Guangyan Li and Yongqiang Tang and Wensheng Zhang},
  journal= {arXiv preprint arXiv:2404.09695},
  year   = {2024}
}

备注

8 pages,4 figures