Mosaic:面向资源高效LLM的组合投影剪枝
机器学习
2025-08-14 v2 人工智能
摘要
大型语言模型(LLM)的广泛计算和存储需求限制了其在任何硬件上的部署。压缩方法,如剪枝,可以减少模型规模,从而降低资源需求。最先进的剪枝基于粗粒度方法,耗时且本质上会移除关键模型参数,严重影响被剪枝模型的质量。本文引入投影剪枝,一种新的面向LLM的细粒度剪枝方法。此外,通过我们提出的组合投影剪枝方法增强了LLM投影剪枝——即无结构剪枝保持准确性与有结构剪枝减少模型规模的协同组合。我们开发了Mosaic,用于创建和部署使用组合投影剪枝的被剪枝LLM的 novel system。在多个硬件平台、LLM和数据集上评估了Mosaic,使用各种性能和质量指标。Mosaic在生产模型方面比现有方法快7.19倍。Mosaic模型在困惑度上实现最高可达84.2%的降低,在准确率上实现最高可达31.4%的提升,超过了基于粗粒度剪枝获得的模型。Mosaic模型实现推理速度最高可达67%的加速,GPU内存使用降低最高可达68%。Mosaic已可在 https://github.com/blessonvar/Mosaic 上公开获取。
引用
@article{arxiv.2504.06323,
title = {Mosaic: Composite Projection Pruning for Resource-efficient LLMs},
author = {Bailey J. Eccles and Leon Wong and Blesson Varghese},
journal= {arXiv preprint arXiv:2504.06323},
year = {2025}
}