当 BERT 抽取彩票时,所有票券都是赢家
计算与语言
2020-10-27 v2 机器学习
摘要
大型基于 Transformer 的模型被证明可缩减为较少数量的自注意力头和层。我们从彩票假设的角度考虑这一现象,使用结构化和幅度剪枝。对于微调后的 BERT,我们表明 (a) 可以找到达到与完整模型相当性能的子网络,且 (b) 从模型其余部分采样的类似大小子网络表现更差。引人注目的是,在结构化剪枝下即便是最差的子网络仍高度可训练,表明大多数预训练 BERT 权重潜在有用。我们还研究“好”的子网络,看其成功是否可归因于更优的语言学知识,但发现它们不稳定,且无法由有意义的自注意力模式解释。
引用
@article{arxiv.2005.00561,
title = {When BERT Plays the Lottery, All Tickets Are Winning},
author = {Sai Prasanna and Anna Rogers and Anna Rumshisky},
journal= {arXiv preprint arXiv:2005.00561},
year = {2020}
}
备注
EMNLP 2020 camera-ready