后训练统计校准以实现更高激活稀疏性
机器学习
2024-12-11 v1 人工智能
摘要
我们提出了统计校准激活剪枝(SCAP),一种后训练激活剪枝框架,(1)通过全连接层的输入激活泛化稀疏化,以在Transformer中实现通用和灵活的应用,(2)采用简单的模式中心化技术对激活分布进行预校准,以最大化后训练稀疏性。我们的结果展示了与先前方法相比稳健的帕累托效率,在同等模型质量下实现了相对于CATS的1.5倍额外LLM解码加速。SCAP的有效性在广泛的模型上得到了实证验证,包括最近的Transformer解码器、MoE、Mamba2、编码Transformer和预量化模型,突出了其实用性和可扩展性。代码可在以下地址获取:https://github.com/IntelLabs/SCAP。
引用
@article{arxiv.2412.07174,
title = {Post-Training Statistical Calibration for Higher Activation Sparsity},
author = {Vui Seng Chua and Yujie Pan and Nilesh Jain},
journal= {arXiv preprint arXiv:2412.07174},
year = {2024}
}
备注
ENLSP-IV NeurIPS Workshop 2024