中文

当 BERT 抽取彩票时,所有票券都是赢家

计算与语言 2020-10-27 v2 机器学习

摘要

大型基于 Transformer 的模型被证明可缩减为较少数量的自注意力头和层。我们从彩票假设的角度考虑这一现象,使用结构化和幅度剪枝。对于微调后的 BERT,我们表明 (a) 可以找到达到与完整模型相当性能的子网络,且 (b) 从模型其余部分采样的类似大小子网络表现更差。引人注目的是,在结构化剪枝下即便是最差的子网络仍高度可训练,表明大多数预训练 BERT 权重潜在有用。我们还研究“好”的子网络,看其成功是否可归因于更优的语言学知识,但发现它们不稳定,且无法由有意义的自注意力模式解释。

关键词

引用

@article{arxiv.2005.00561,
  title  = {When BERT Plays the Lottery, All Tickets Are Winning},
  author = {Sai Prasanna and Anna Rogers and Anna Rumshisky},
  journal= {arXiv preprint arXiv:2005.00561},
  year   = {2020}
}

备注

EMNLP 2020 camera-ready