DuoGPT:基于激活感知剪枝的无训练双稀疏LLM
机器学习
2025-11-14 v3
摘要
大型语言模型(LLMs)虽然在性能方面表现出色,但由于高内存和计算开销,难以部署。尽管修剪可以降低这些需求,但大多数方法忽略了运行时观察到的激活稀疏性。我们将激活稀疏性重新解释为动态结构化权重稀疏性,提出了 DuoGPT 框架,通过结合无结构权重修剪和激活稀疏性构建双稀疏(spMspV)工作负载。为保持准确性,我们将Optimal Brain Compression (OBC)框架扩展到激活感知校准,并引入来自稠密模型的输出残差作为校正项。我们进一步针对高效GPU执行优化解决方案,实现了对十亿参数LLM的可扩展性。在LLaMA-2和LLaMA-3上的评估显示,DuoGPT 在基准稠密模型上以最高达 9.17% 的准确率优势,在等加速度比(1.39)下显现出色。代码已在Github上提供。
引用
@article{arxiv.2506.20194,
title = {DuoGPT: Training-free Dual Sparsity through Activation-aware Pruning in LLMs},
author = {Ruokai Yin and Yuhang Li and Donghyun Lee and Priyadarshini Panda},
journal= {arXiv preprint arXiv:2506.20194},
year = {2025}
}
备注
NeurIPS 2025. The code is available on Github (see hyperlink in the paper)