一种简单而有效的大语言模型剪枝方法
计算与语言
2024-05-07 v3 人工智能
机器学习
摘要
随着规模增大,大语言模型(LLMs)成为网络剪枝方法的天然候选:这类方法丢弃部分网络权重同时努力保持性能。然而,现有方法要么需要重训练(对于十亿规模 LLM 而言几乎难以负担),要么需要求解依赖二阶信息的权重重构问题,这同样可能计算昂贵。在本文中,我们引入一种新颖、直接而有效的剪枝方法,称为 Wanda(按权重与激活值剪枝,Pruning by Weights and activations),旨在使预训练 LLM 稀疏化。受近期 LLM 中涌现大模值特征的观察启发,我们的方法在每个输出基础上剪枝具有最小模值乘以相应输入激活值的权重。值得注意的是,Wanda 不需要重训练或权重更新,且剪枝后的 LLM 可原样使用。我们在 LLaMA 与 LLaMA-2 上跨多种语言基准对我们的方法 Wanda 进行了 thorough 评估。Wanda 显著优于既定的模值剪枝基线,并与近期涉及密集权重更新的方法具有竞争力。代码见 https://github.com/locuslab/wanda。
引用
@article{arxiv.2306.11695,
title = {A Simple and Effective Pruning Approach for Large Language Models},
author = {Mingjie Sun and Zhuang Liu and Anna Bair and J. Zico Kolter},
journal= {arXiv preprint arXiv:2306.11695},
year = {2024}
}
备注
ICLR 2024. Website at https://eric-mingjie.github.io/wanda/home.html