大预训练模型中本质稀疏性的涌现:至关重要的权重
机器学习
2023-08-11 v2
摘要
大型预训练 transformer 是现代深度学习中引人瞩目的存在,随着其规模增长,理解其中存在的简约模式变得至关重要。随着参数量爆炸式增长,Lottery Ticket Hypothesis(LTH)及其变体在稀疏化方面已失去实用性,因为迭代幅度剪枝(IMP)这种重复训练-剪枝-重训练的例程所带来的计算与内存瓶颈随模型增大而恶化。本文全面研究了多个大型预训练视觉与语言 transformer 中诱导出的稀疏模式。我们提出{\em 本质稀疏性}的存在:当我们以一次性方式直接移除量级最小的权重而不重训练时,存在一个陡降点,超过该点后性能随稀疏度上升而急剧下降。我们还发现本质稀疏性对 N:M 稀疏模式以及现代规模的大语言模型(Vicuna-7B)同样成立。我们还呈现了 BERT 预训练期间突然稀疏化的有趣涌现现象,即 BERT 在若干迭代后于预训练中突然变得高度稀疏。此外,我们的观察还指出一个反直觉发现:使用更大量预训练数据训练的 BERT 倾向于在相对更少的参数中更好地浓缩知识。最后,我们考察了预训练损失对本质稀疏性的影响,发现自监督学习(SSL)目标比监督学习(SL)引发更强的涌现稀疏化特性。我们的代码可在 \url{https://github.com/VITA-Group/essential_sparsity} 获取。
引用
@article{arxiv.2306.03805,
title = {The Emergence of Essential Sparsity in Large Pre-trained Models: The Weights that Matter},
author = {Ajay Jaiswal and Shiwei Liu and Tianlong Chen and Zhangyang Wang},
journal= {arXiv preprint arXiv:2306.03805},
year = {2023}
}
备注
Added new results on LLMs and N:M Sparsity