BESA:基于分块参数高效稀疏分配的大语言模型剪枝
机器学习
2024-04-22 v2 人工智能
计算与语言
摘要
大语言模型(LLMs)在文本摘要、文本问答等各种任务中展现了卓越性能。尽管其性能令人印象深刻,但庞大的参数量导致的计算开销可能令人望而却步。SparseGPT 和 Wanda 等现有解决方案试图通过权重剪枝来缓解这一问题。然而,它们的逐层方法会导致模型输出产生显著扰动,并需要精细的超参数调整(如剪枝率),这可能 adversely 影响整体模型性能。为此,本文提出了一种名为分块参数高效稀疏分配(BESA)的新型 LLM 剪枝技术,该技术通过应用分块重构损失来实现。与典型的逐层剪枝技术相比,BESA 具有两个显著特征:i) 它针对单个 Transformer 块的整体剪枝误差;ii) 它以可微分的方式分配特定于层的稀疏度,这两点均确保了剪枝后性能降级的降低。实验表明,BESA 实现了最先进的性能,仅需单块 A100 GPU 并在五小时内即可高效剪枝参数量从 7B 到 70B 的 LLaMA1 和 LLaMA2 等大语言模型。代码地址:https://github.com/OpenGVLab/LLMPrune-BESA。
引用
@article{arxiv.2402.16880,
title = {BESA: Pruning Large Language Models with Blockwise Parameter-Efficient Sparsity Allocation},
author = {Peng Xu and Wenqi Shao and Mengzhao Chen and Shitao Tang and Kaipeng Zhang and Peng Gao and Fengwei An and Yu Qiao and Ping Luo},
journal= {arXiv preprint arXiv:2402.16880},
year = {2024}
}