关于丢弃预训练 Transformer 模型层的影响
计算与语言
2022-08-16 v3 机器学习
摘要
基于 Transformer 的自然语言处理(NLP)模型使用数亿乃至数十亿参数进行训练,限制了其在计算受限环境中的适用性。虽然参数数量通常与性能相关,但尚不清楚下游任务是否需要整个网络。受近期关于剪枝和蒸馏预训练模型工作的启发,我们探索了丢弃预训练模型中层的策略,并观察了剪枝对下游 GLUE 任务的影响。我们能够将 BERT、RoBERTa 和 XLNet 模型剪枝多达 40%,同时保持其原始性能的 98%。此外,我们表明我们的剪枝模型在规模和性能上均与使用知识蒸馏构建的模型相当。我们的实验得出了一些有趣的观察,例如:(i)较低层对维持下游任务性能最为关键;(ii)某些任务如复述检测和句子相似度对丢弃层更具鲁棒性;(iii)使用不同目标函数训练的模型表现出不同的学习模式以及关于层丢弃的不同表现。
引用
@article{arxiv.2004.03844,
title = {On the Effect of Dropping Layers of Pre-trained Transformer Models},
author = {Hassan Sajjad and Fahim Dalvi and Nadir Durrani and Preslav Nakov},
journal= {arXiv preprint arXiv:2004.03844},
year = {2022}
}