基于微分包含的预训练 Transformer 自适应剪枝
机器学习
2025-03-03 v2
摘要
大型 Transformer 展现出显著的成功,这使得在保持其性能的同时压缩这些模型以降低推理成本变得必要。当前的压缩算法以固定的压缩比对 Transformer 进行剪枝,每个比例都需要一个独特的剪枝过程,导致计算成本高昂。相比之下,我们提出基于掩码参数的微分包含,在单个剪枝阶段内以任意所需比例对预训练 Transformer 进行剪枝。这种动态可以生成掩码参数的整个正则化解路径,其支撑集标识了网络结构。因此,该解路径标识了具有不同稀疏度的 Transformer 权重族,提供了更大的灵活性和定制性。在本文中,我们引入了这样一种有效的剪枝方法,称为 SPP(Solution Path Pruning,解路径剪枝)。为了实现有效剪枝,我们将 Transformer 划分为成对模块,包括 query-key 对、value-projection 对和连续线性层,并对这些模块对应用低秩压缩,在保持输出结构的同时实现内部状态的结构化压缩。在各种知名 Transformer 骨干网络上进行的广泛实验证明了 SPP 的有效性。
关键词
引用
@article{arxiv.2501.03289,
title = {Adaptive Pruning of Pretrained Transformer via Differential Inclusions},
author = {Yizhuo Ding and Ke Fan and Yikai Wang and Xinwei Sun and Yanwei Fu},
journal= {arXiv preprint arXiv:2501.03289},
year = {2025}
}