PASER:面向剪枝大型语言模型的后训练数据选择方法
计算与语言
2026-02-13 v3
摘要
模型剪枝是压缩大型语言模型(LLM)的有效方法。然而,这一过程常常导致模型能力显著下降。虽然 instruction tuning 等后训练技术常用于恢复模型性能,但现有方法往往忽视模型能力不均衡的退化,并面临高计算成本。此外,一些无关的指令也可能对模型能力恢复产生负面影响。为应对这些挑战,我们提出了 \textbf{P}ost-training d\textbf{A}ta \textbf{S}election method for \textbf{E}fficient pruned large language model \textbf{R}ecovery(\textbf{PASER})。PASER旨在识别在一定数据预算下能够恢复最受损模型能力的指令。我们的 方法首先应用流形学习和谱聚类在语义空间中对恢复指令进行分组,揭示特定能力的指令集合。随后,根据相应模型能力退化的程度,对数据预算在各聚类之间进行自适应分配。在每个聚类中,我们优先选择导致模型性能下降最严重的数据样本。为缓解潜在的负面调优效应,我们还检测并过滤掉冲突或无关的恢复数据。大量实验表明,PASER显著优于传统基线方法,在仅使用原始后训练数据的 4\%\textasciitilde20\%的情况下,有效恢复了被剪枝 LLM 的通用能力。我们提供了代码仓库链接。
引用
@article{arxiv.2502.12594,
title = {PASER: Post-Training Data Selection for Efficient Pruned Large Language Model Recovery},
author = {Bowei He and Lihao Yin and Hui-Ling Zhen and Xiaokun Zhang and Mingxuan Yuan and Chen Ma},
journal= {arXiv preprint arXiv:2502.12594},
year = {2026}
}
备注
Accepted by ICLR 2026