中文

警惕用于剪枝大型语言模型的校准数据

计算与语言 2025-07-01 v2 人工智能 机器学习

摘要

随着大型语言模型(LLMs)在各个领域的广泛应用,模型压缩对于降低成本和提升推理效率变得日益关键。训练后剪枝是一种有前景的方法,它不需要资源密集型的迭代训练,仅需少量校准数据来评估参数重要性。最近的研究从不同方面改进了训练后剪枝,但很少有研究系统地探索校准数据的影响,并且也不清楚是否存在更好的校准数据构建策略。我们填补了这一空白,并惊人地观察到校准数据对训练后剪枝也至关重要,尤其是在高稀疏度情况下。通过对校准数据重要影响因素(包括剪枝设置、数据量及其与预训练数据的相似性)进行控制实验,我们观察到少量数据就足够了,并且与预训练阶段更相似的数据能带来更好的性能。由于高级LLMs的预训练数据通常不可访问,我们进一步提供了一种自生成校准数据合成策略来构建可行的校准数据。在近期强大的开源LLMs(例如DCLM和LLaMA-3)上的实验结果表明,所提出的策略可以大幅提升强剪枝方法(例如Wanda、DSnoT、OWL)的性能(最高提升2.68%2.68\%)。代码可在https://github.com/Dereck0602/calibration_data获取。

关键词

引用

@article{arxiv.2410.17711,
  title  = {Beware of Calibration Data for Pruning Large Language Models},
  author = {Yixin Ji and Yang Xiang and Juntao Li and Qingrong Xia and Ping Li and Xinyu Duan and Zhefeng Wang and Min Zhang},
  journal= {arXiv preprint arXiv:2410.17711},
  year   = {2025}
}

备注

Published as a conference paper at ICLR 2025