LaCo: 基于层折叠的大语言模型剪枝
计算与语言
2024-10-16 v2 人工智能
摘要
基于 Transformer 的大语言模型(LLM)正经历显著的参数规模扩张趋势,这给模型训练和推理带来了巨大的成本。然而,现有的方法如模型量化、知识蒸馏和模型剪枝受到各种问题的制约,包括硬件支持限制、需要大量训练以及改变模型内部结构。在本文中,我们提出了一种简洁的层级结构化剪枝器,称为 \textit{Layer Collapse (LaCo)},其中模型的后部层折叠到前部层中,在保持模型结构的同时实现模型规模的快速缩减。综合实验表明,我们的方法在 25-30\% 的剪枝率下保持了超过 80\% 的平均任务性能,显著优于现有的 SOTA 结构化剪枝方法。我们还进行了训练后实验,以确认 \textit{LaCo} 有效地继承了原始模型的参数。此外,我们对 \textit{LaCo} 的各种设置进行了消融研究。最后,我们从层级相似性的角度讨论了我们的动机,并评估了剪枝后的 LLM 在各种剪枝率下的性能\footnote{\url{https://github.com/yangyifei729/LaCo}}。
引用
@article{arxiv.2402.11187,
title = {LaCo: Large Language Model Pruning via Layer Collapse},
author = {Yifei Yang and Zouying Cao and Hai Zhao},
journal= {arXiv preprint arXiv:2402.11187},
year = {2024}
}
备注
Accepted as Findings of EMNLP2024