评估压缩技术对大语言模型任务特定性能的影响
计算与语言
2024-09-18 v1
摘要
大语言模型(LLMs)提供了强大的能力,但也带来了巨大的计算成本,这推动了对高效压缩技术的需求。本研究评估了流行的压缩方法——幅度剪枝、SparseGPT 和 Wanda——对 LLaMA-2-7B 模型的影响,重点关注模型大小缩减、下游任务性能以及校准数据作用之间的权衡。我们的发现表明,虽然 SparseGPT 和 Wanda 即使在 50% 稀疏度下也能保持困惑度,但它们在下游任务上性能显著下降,这凸显了仅将困惑度作为唯一评估指标的不足。为解决此问题,我们引入 Jensen-Shannon (JS) 散度作为一个更全面的指标,它能捕捉压缩后模型行为的细微变化。我们进一步证明,与通用校准数据相比,任务特定的校准数据能显著提升压缩模型的下游性能。这项研究强调了采用多样化评估指标和谨慎选择校准数据的必要性,以充分理解 LLM 压缩的复杂性及其对实际应用的影响。
引用
@article{arxiv.2409.11233,
title = {Evaluating the Impact of Compression Techniques on Task-Specific Performance of Large Language Models},
author = {Bishwash Khanal and Jeffery M. Capone},
journal= {arXiv preprint arXiv:2409.11233},
year = {2024}
}