Sheared LLaMA:通过结构化剪枝加速语言模型预训练
计算与语言
2024-04-12 v2 人工智能
机器学习
摘要
LLaMA(Touvron 等人,2023a;b)以及其他近期出现的中等规模大语言模型(LLM)的流行,凸显了构建更小但强大的 LLM 的潜力。尽管如此,从零开始在数万亿 token 上训练此类模型的成本仍然很高。在这项工作中,我们将结构化剪枝作为一种有效手段,从预训练的大型模型开发更小的 LLM。我们的方法采用两项关键技术:(1)定向结构化剪枝,以端到端方式移除层、头以及中间和隐藏维度,将较大的模型剪枝至指定的目标形状;(2)动态批次加载,根据不同领域间变化的损失动态更新每个训练批次中采样数据的构成。我们通过提出 Sheared-LLaMA 系列来展示我们方法的有效性,将 LLaMA2-7B 模型剪枝至 1.3B 和 2.7B 参数。Sheared-LLaMA 模型在广泛的下游和指令微调评估中优于同等规模的最先进开源模型,如 Pythia、INCITE、OpenLLaMA 以及同时期的 TinyLlama 模型,而所需计算量仅相当于从零训练此类模型的 3%。本工作提供了令人信服的证据,表明利用现有 LLM 配合结构化剪枝是构建有竞争力的小规模 LLM 的一种更具成本效益的方法。
引用
@article{arxiv.2310.06694,
title = {Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning},
author = {Mengzhou Xia and Tianyu Gao and Zhiyuan Zeng and Danqi Chen},
journal= {arXiv preprint arXiv:2310.06694},
year = {2024}
}
备注
The code and models are available at https://github.com/princeton-nlp/LLM-Shearing