中文

变化是唯一的不变:基于层冗余度的动态大语言模型切片

计算与语言 2024-11-07 v1 人工智能 机器学习

摘要

本文通过在大语言模型(LLM)中引入动态的逐层剪枝,提出了一种新颖的模型压缩方法,对SliceGPT建立的经典方法进行了改进。通过从恒定切片过渡到动态切片,我们的方法利用了新提出的层冗余度(LR)分数,该分数通过测量层输入与输出的余弦相似度来评估每一层对其输入的改变程度。我们利用这个分数,根据冗余度对单个层的部分进行剪枝,使得所有层的平均剪枝百分比保持固定值。我们使用Llama3-8B和Mistral-7B等模型在多个数据集上进行了大量实验,评估了不同的切片基数和百分比,以确定平衡效率与性能的最佳配置。我们的研究结果表明,与恒定切片方法建立的基线相比,我们的动态切片方法不仅保持了模型性能,而且在许多情况下还提升了性能。例如,在几种设置中,我们观察到性能相比SliceGPT基线提升了高达5%。此外,在多个基准测试中,困惑度下降了多达7%,验证了我们方法的有效性。代码、模型权重和数据集已在https://github.com/RazvanDu/DynamicSlicing开源。

关键词

引用

@article{arxiv.2411.03513,
  title  = {Change Is the Only Constant: Dynamic LLM Slicing based on Layer Redundancy},
  author = {Razvan-Gabriel Dumitru and Paul-Ioan Clotan and Vikas Yadav and Darius Peteleaza and Mihai Surdeanu},
  journal= {arXiv preprint arXiv:2411.03513},
  year   = {2024}
}

备注

Accepted at EMNLP Findings 2024