中文

揭示 BERT 的黑暗秘密

计算与语言 2019-09-12 v2 机器学习 机器学习

摘要

基于 BERT 的架构目前在众多自然语言处理(NLP)任务上取得了最先进的性能,但人们对其成功背后的确切机制知之甚少。在当前工作中,我们专注于自注意力机制的解释,这是 BERT 的基本底层组件之一。我们使用 GLUE 任务的一个子集和一组手工设计的兴趣特征,提出了一套方法论,并对各个 BERT 注意力头所编码的信息进行了定性和定量分析。我们的发现表明,存在一组有限的注意力模式在不同的头之间重复出现,这表明模型整体存在过度参数化。虽然不同的头始终使用相同的注意力模式,但它们在不同任务上对性能的影响各不相同。我们证明,手动禁用某些头中的注意力可以比常规微调的 BERT 模型带来性能提升。

关键词

引用

@article{arxiv.1908.08593,
  title  = {Revealing the Dark Secrets of BERT},
  author = {Olga Kovaleva and Alexey Romanov and Anna Rogers and Anna Rumshisky},
  journal= {arXiv preprint arXiv:1908.08593},
  year   = {2019}
}

备注

Accepted to EMNLP 2019