$D^2Prune$:基于双重泰勒展开与注意力分布感知的大语言模型稀疏化
机器学习
2026-04-01 v1
摘要
大语言模型(LLM)因其庞大的计算需求而面临重大的部署挑战。尽管剪枝提供了一种有前景的压缩方案,但现有方法存在两个关键局限:(1)它们忽略了校准数据与测试数据之间的激活分布偏移,导致误差估计不准确;(2)它们忽视了注意力模块中激活的长尾分布特征。为解决这些局限,本文提出了一种新颖的剪枝方法 。首先,我们提出了一种基于双重泰勒展开的方法,联合建模权重与激活扰动以实现精确的误差估计,从而实现精确的剪枝掩码选择与权重更新,并促进剪枝过程中的误差最小化。其次,我们提出了一种注意力感知的动态更新策略,通过联合最小化注意力分布的 KL 散度与重构误差来保持长尾注意力模式。大量实验表明, 在各种 LLM(例如 OPT-125M、LLaMA2/3 和 Qwen3)上始终优于 SOTA 方法。此外,动态注意力更新机制也能很好地泛化至基于 ViT 的视觉模型(如 DeiT),在 ImageNet-1K 上实现了更高的准确率。
引用
@article{arxiv.2601.09176,
title = {$D^2Prune$: Sparsifying Large Language Models via Dual Taylor Expansion and Attention Distribution Awareness},
author = {Lang Xiong and Ning Liu and Ao Ren and Yuheng Bai and Haining Fang and BinYan Zhang and Zhe Jiang and Yujuan Tan and Duo Liu},
journal= {arXiv preprint arXiv:2601.09176},
year = {2026}
}