BERT破坏者:破坏Transformer的离群维度
计算与语言
2021-06-04 v2
摘要
多项研究表明Transformer对剪枝异常鲁棒。与这一公认看法相反,我们证明预训练Transformer编码器对层输出中极少量特征(<0.0001%的模型权重)的移除异常脆弱。在BERT和其他预训练编码器Transformer中,受影响的组件是LayerNorm中的缩放因子和偏置。这些离群点是高幅值归一化参数,在预训练早期出现,并在整个模型中持续出现在相同的维度位置。我们表明,禁用它们会显著恶化MLM损失和下游任务性能。该效应在多个BERT系列模型和其他流行预训练Transformer架构(包括BART、XLNet和ELECTRA)中均观察到;我们也展示了GPT-2中的类似效应。
引用
@article{arxiv.2105.06990,
title = {BERT Busters: Outlier Dimensions that Disrupt Transformers},
author = {Olga Kovaleva and Saurabh Kulshreshtha and Anna Rogers and Anna Rumshisky},
journal= {arXiv preprint arXiv:2105.06990},
year = {2021}
}
备注
Accepted as long paper at Findings of ACL 2021