层即拼图:通过层拼接压缩大型语言模型
计算机视觉与模式识别
2025-10-20 v1 机器学习
摘要
大型语言模型在自然语言处理任务中表现卓越,但其巨大规模导致高计算和存储需求。最近的工作寻求通过层级结构化剪枝来降低模型规模。然而,这些方法倾向于忽略保留被剪枝部分能力。在本工作中,我们重新审视结构化剪枝范式,发现若干关键局限性:1)由于直接删除层导致显著性能下降,2)无效的线性权重层聚合,3)缺乏有效的事后恢复机制。为了解决这些局限性,我们提出CoMe,包括一个渐进式层剪枝框架,采用基于拼接的合并技术,以及层次化蒸馏事后训练过程。具体而言,我们引入一种通道灵敏度度量,利用激活强度和权重范数进行细粒度通道选择。随后,我们采用基于拼接的层合并方法,以融合相邻层中最关键的通道,实现渐进式模型规模减小。最后,我们提出一种层次化蒸馏协议,利用在剪枝期间建立的原始模型和被剪枝模型层之间的对应关系,从而实现高效的知识传递。在七个基准测试上的实验表明,CoMe实现了最佳性能;当剪枝30%的LLaMA-2-7b参数时,被剪枝模型保留了其原始平均准确率的83%。我们的代码可在https://github.com/MPI-Lab/CoMe获取。
引用
@article{arxiv.2510.15304,
title = {Layer as Puzzle Pieces: Compressing Large Language Models through Layer Concatenation},
author = {Fei Wang and Li Shen and Liang Ding and Chao Xue and Ye Liu and Changxing Ding},
journal= {arXiv preprint arXiv:2510.15304},
year = {2025}
}