LoSparse:基于低秩与稀疏近似的大语言模型结构化压缩
机器学习
2023-06-27 v2 计算与语言
摘要
Transformer 模型在各种自然语言任务中取得了显著成果,但它们通常过于庞大,需要大量的内存和计算资源。为降低这些模型的规模和复杂度,我们提出 LoSparse(低秩与稀疏近似),一种新颖的模型压缩技术,它将权重矩阵近似为低秩矩阵与稀疏矩阵之和。我们的方法结合了低秩近似和剪枝两者的优势,同时避免了它们的局限。低秩近似压缩神经元中连贯且具表达力的部分,而剪枝去除神经元中不连贯且无表达力的部分。剪枝增强了低秩近似的多样性,而低秩近似防止剪枝丢失过多具表达力的神经元。我们在自然语言理解、问答和自然语言生成任务上评估了我们的方法。我们表明它显著优于现有的压缩方法。
引用
@article{arxiv.2306.11222,
title = {LoSparse: Structured Compression of Large Language Models based on Low-Rank and Sparse Approximation},
author = {Yixiao Li and Yifan Yu and Qingru Zhang and Chen Liang and Pengcheng He and Weizhu Chen and Tuo Zhao},
journal= {arXiv preprint arXiv:2306.11222},
year = {2023}
}