Amber Pruner:利用N:M激活稀疏加速大语言模型的预填充阶段
机器学习
2025-08-05 v1 人工智能
摘要
在大语言模型(LLM)时代,N:M稀疏已成为加速推理的关键结构化压缩技术。虽然已有工作主要关注权重稀疏,但常因显著的精度下降。相较之下,激活稀疏虽具前景,却往往依赖训练且难以泛化。为此,我们引入Amber Pruner,一种专为预填充阶段设计的、无需训练的N:M激活稀疏方法,旨加速LLM中的线性投影层。广泛实验表明,Amber Pruner能在多种模型和稀疏比例(2:4、4:8、8:16)下,无需模型再训练即可稀疏化并加速超过55%的线性计算。为进一步提升通用性与效率,我们提出Outstanding-sparse框架,将Amber Pruner与事后W8A8量化集成。该方法在多种下游任务上保持强性能,尤其在生成任务中表现突出。本工作开创了激活稀疏的新前沿,为算法与架构的协同演进提供了基础性洞见,指引下一代AI系统的设计。
引用
@article{arxiv.2508.02128,
title = {Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models},
author = {Tai An and Ruwu Cai and Yanzhe Zhang and Yang Liu and Hao Chen and Pengcheng Xie and Sheng Chang and Yiwu Yao and Gongyi Wang},
journal= {arXiv preprint arXiv:2508.02128},
year = {2025}
}