剪枝、更新与微调:面向大语言模型的鲁棒结构化剪枝
机器学习
2026-05-19 v1
摘要
近年来,大语言模型经历了显著的增长与发展。然而,对 LLM 执行推理仍然成本高昂,尤其是在长上下文推理或资源受限的设备上。这促使了新型训练后剪枝(PTP)方法的发展。这些方法通过移除模型参数的绝大部分来降低 LLM 的需求。被丢弃的权重是根据它们对模型性能的影响来选择的。当前的 PTP 方法通过移除 FFN 层中信息量较少的隐藏节点和最不重要的注意力层来剪枝模型。我们提出了 Putri,一种对现有技术引入三项改变的 PTP 方法。首先,我们更新 FFN 的未剪枝权重,以补偿引入的剪枝误差。其次,FFN 层按顺序进行剪枝,并考虑到对先前层所做的更新。第三,我们移除单个注意力头,而不是移除整个注意力层。我们扩展了该方法,使其也能处理分组查询注意力。总而言之,Putri 是一种结构化剪枝方法,在保持简单的同时展现出 SOTA 性能。在多个模型上、广泛的稀疏度范围下以及不同数据集上进行的剪枝实验,验证了 Putri 的通用性。值得注意的是,我们证明了与以往的方法不同,Putri 能够在极端稀疏率下对 LLM 进行剪枝。代码可在以下地址获取:https://github.com/Coello-dev/Putri。
引用
@article{arxiv.2605.18331,
title = {Prune, Update and Trim: Robust Structured Pruning for Large Language Models},
author = {Diego Coello de Portugal Mecke and Tom Hanika and Lars Schmidth-Thieme},
journal= {arXiv preprint arXiv:2605.18331},
year = {2026}
}