FinerCut:面向大型语言模型的更细粒度可解释层级剪枝
机器学习
2024-10-22 v2
摘要
过参数化的 transformer 网络是大型语言模型(LLM)的前沿架构。然而,这类模型包含数十亿参数,需大量计算资源,同时引发环境问题。为此,我们提出了 FinerCut,一种新的细粒度层级剪枝方法,不同于以前在 transformer 块级别进行的剪枝,FinerCut 将所有自注意力层和前馈网络(FFN)层视为独立的剪枝候选对象。FinerCut 通过剔除对模型输出影响最小的层,实现一种新的、精简的、可解释且任务无关的剪枝方法。在 9 个基准测试中,我们的方法在移除 25% 层后保留了 Llama3-8B 的 90% 性能,在移除 30% 层后保留了 Llama3-70B 的 95% 性能,且无需微调或后置重构。令人惊讶的是,FinerCut 的结果令人关注:Llama3-70B 中 42%(共 80 个自注意力层中的 34 个)可被移除,同时保持 99% 的性能——在移除后无需额外微调。此外,FinerCut 提供了工具,用于检查被剪枝层的类型和位置,使我们能够观察到有趣的剪枝行为。例如,我们观察到倾向于在更深的连续解码器层中剪除自注意力层的趋势。我们希望这些发现能激发未来高效 LLM 架构设计的灵感。
关键词
引用
@article{arxiv.2405.18218,
title = {FinerCut: Finer-grained Interpretable Layer Pruning for Large Language Models},
author = {Yang Zhang and Yawei Li and Xinpeng Wang and Qianli Shen and Barbara Plank and Bernd Bischl and Mina Rezaei and Kenji Kawaguchi},
journal= {arXiv preprint arXiv:2405.18218},
year = {2024}
}
备注
Accepted by Compression Worshop at NeurIPS 2024