中文

BERT 在看什么?对 BERT 注意力机制的分析

计算与语言 2019-06-12 v1

摘要

像 BERT 这样的大型预训练神经网络近期在自然语言处理(NLP)中取得了巨大成功,这促使越来越多的研究去探究它们能从无标签数据中学到语言的哪些方面。最近的分析大多聚焦于模型输出(如语言模型意外度)或内部向量表示(如探针分类器)。作为这些工作的补充,我们提出了分析预训练模型注意力机制的方法,并将其应用于 BERT。BERT 的注意力头展现出诸如关注分隔符 token、特定位置偏移或广泛关注整个句子等模式,同一层中的头常常表现出相似的行为。我们进一步表明,某些注意力头与句法和共指的语言学概念有很好的对应关系。例如,我们发现了以极高准确率关注动词的直接宾语、名词的限定词、介词的宾语以及共指提及的头。最后,我们提出了一种基于注意力的探针分类器,并用它进一步证明 BERT 的注意力中捕获了大量的句法信息。

关键词

引用

@article{arxiv.1906.04341,
  title  = {What Does BERT Look At? An Analysis of BERT's Attention},
  author = {Kevin Clark and Urvashi Khandelwal and Omer Levy and Christopher D. Manning},
  journal= {arXiv preprint arXiv:1906.04341},
  year   = {2019}
}

备注

BlackBoxNLP 2019