中文

STAT:训练后收缩Transformer

机器学习 2024-06-04 v1 人工智能 计算与语言

摘要

我们提出STAT:一种无需微调即可剪枝Transformer模型的简单算法。STAT通过计算下一层权重的修正量来消除网络中的注意力头和神经元,同时保持精度。网络中的每个层块都通过一系列保持网络结构的、基于原则的矩阵分解进行压缩。我们的整个算法只需几分钟即可压缩BERT,使用单个GPU压缩70亿参数模型不到三小时。仅使用几百个数据样本,STAT就能保持网络的输出,并优于现有的无梯度剪枝方法。它甚至能与包含大量微调的方法相竞争。我们在编码器和解码器架构上展示了我们的方法,包括BERT、DistilBERT和Llama-2,并使用GLUE、SQuAD、WikiText2等基准进行了测试。

关键词

引用

@article{arxiv.2406.00061,
  title  = {STAT: Shrinking Transformers After Training},
  author = {Megan Flynn and Alexander Wang and Dean Edward Alvarez and Christopher De Sa and Anil Damle},
  journal= {arXiv preprint arXiv:2406.00061},
  year   = {2024}
}