BERT 中的注意力头是否习得了成分语法?
计算与语言
2021-06-03 v2
摘要
随着近年来预训练语言模型的成功,越来越多的研究者聚焦于打开这些模型的“黑箱”。基于此兴趣,我们对 BERT 和 RoBERTa 的注意力头中的成分语法进行了定性与定量分析。我们采用句法距离方法从每个头的注意力权重中提取隐式成分语法。我们的结果表明,存在某些头能够比基线更好地诱导出若干语法类型,意味着一些头充当了成分语法的代理。我们还分析了在使用两类任务(包括句子语义相似度(SMS)任务和自然语言推理(NLI)任务)微调后,注意力头的成分语法诱导(CGI)能力如何变化。我们的结果表明,SMS 任务降低了上层的平均 CGI 能力,而 NLI 任务提升了该能力。最后,我们探究了在 QQP 和 MNLI 任务上 CGI 能力与自然语言理解能力之间的联系。
引用
@article{arxiv.2102.07926,
title = {Have Attention Heads in BERT Learned Constituency Grammar?},
author = {Ziyang Luo},
journal= {arXiv preprint arXiv:2102.07926},
year = {2021}
}
备注
Accept at the EACL 2021 Student Research Workshop