面向设备端的轻量级后训练结构化剪枝
机器学习
2025-01-28 v1 人工智能
摘要
考虑到结构化剪枝在硬件友好性和广泛适用性方面的优势,结构化剪枝已成为有效降低大型语言模型(LLM)在资源受限设备上资源需求的解决方案。传统的结构化剪枝方法通常需要进行微调以恢复性能损失,这会导致高内存开销和 substantial data requirements,从而使其不适用于设备端应用。此外,后训练结构化剪枝技术通常需要特定的激活函数或架构修改,从而限制了其应用范围。本文引入了COMP—a一种轻量级后训练结构化剪枝方法,采用混合粒度剪枝策略。COMP首先在较粗的粒度上基于模型重要性对选定模型层进行剪枝,然后在每个剩余模型层的稠密层中进行细粒度神经元剪枝。为更准确地评估神经元重要性,COMP引入了一种新的基于矩阵条件的度量。随后,COMP利用掩码调优来恢复精度,而无需进行微调,从而显著降低了内存消耗。实验结果表明,COMP在LLaMA-2-7B模型上以20%的剪枝比率相较于LLM-Pruner提高了6.13%的性能,同时将内存开销降低了80%。
引用
@article{arxiv.2501.15255,
title = {Lightweight and Post-Training Structured Pruning for On-Device Large Lanaguage Models},
author = {Zihuai Xu and Yang Xu and Hongli Xu and Yunming Liao and Zhiwei Yao and Zuan Xie},
journal= {arXiv preprint arXiv:2501.15255},
year = {2025}
}