中文

LoSparse:基于低秩与稀疏近似的大语言模型结构化压缩

机器学习 2023-06-27 v2 计算与语言

摘要

Transformer 模型在各种自然语言任务中取得了显著成果,但它们通常过于庞大,需要大量的内存和计算资源。为降低这些模型的规模和复杂度,我们提出 LoSparse(低秩与稀疏近似),一种新颖的模型压缩技术,它将权重矩阵近似为低秩矩阵与稀疏矩阵之和。我们的方法结合了低秩近似和剪枝两者的优势,同时避免了它们的局限。低秩近似压缩神经元中连贯且具表达力的部分,而剪枝去除神经元中不连贯且无表达力的部分。剪枝增强了低秩近似的多样性,而低秩近似防止剪枝丢失过多具表达力的神经元。我们在自然语言理解、问答和自然语言生成任务上评估了我们的方法。我们表明它显著优于现有的压缩方法。

关键词

引用

@article{arxiv.2306.11222,
  title  = {LoSparse: Structured Compression of Large Language Models based on Low-Rank and Sparse Approximation},
  author = {Yixiao Li and Yifan Yu and Qingru Zhang and Chen Liang and Pengcheng He and Weizhu Chen and Tuo Zhao},
  journal= {arXiv preprint arXiv:2306.11222},
  year   = {2023}
}