中文

压缩 BERT:研究权重剪枝对迁移学习的影响

计算与语言 2020-05-18 v2

摘要

预训练通用特征提取器,如用于自然语言处理的 BERT 和用于计算机视觉的 VGG,已成为在不要求更多标注数据的情况下改进深度学习模型的有效方法。尽管有效,但像 BERT 这样的特征提取器在某些部署场景中可能过于庞大。我们探索 BERT 的权重剪枝并追问:预训练期间的压缩如何影响迁移学习?我们发现剪枝在三个宽泛的区间内影响迁移学习。低水平剪枝(30-40%)完全不影响预训练损失或向下游任务的迁移。中等水平剪枝增加了预训练损失,并阻碍有用的预训练信息迁移到下游任务。高水平剪枝进一步阻碍模型拟合下游数据集,导致进一步退化。最后,我们观察到在特定任务上微调 BERT 并不能改善其可剪枝性。我们得出结论:BERT 可以在预训练期间一次性剪枝,而不必针对每个任务分别剪枝,且不影响性能。

关键词

引用

@article{arxiv.2002.08307,
  title  = {Compressing BERT: Studying the Effects of Weight Pruning on Transfer Learning},
  author = {Mitchell A. Gordon and Kevin Duh and Nicholas Andrews},
  journal= {arXiv preprint arXiv:2002.08307},
  year   = {2020}
}

备注

Accepted to Rep4NLP 2020 Workshop at ACL 2020 Conference