中文

讲述 BERT 的完整故事:从局部注意力到全局聚合

机器学习 2021-01-15 v2 计算与语言

摘要

我们深入考察 transformer 架构中自注意力头的行为。鉴于近期研究不鼓励使用注意力分布来解释模型行为,我们表明注意力分布仍可为注意力头的局部行为提供洞见。据此,我们提出由注意力揭示的局部模式与回溯至输入的全局模式之间的区分,并从两个角度分析 BERT。我们利用梯度归因分析注意力头的输出如何依赖于输入词元,有效将基于局部注意力的分析扩展至考量 transformer 各层中的信息混合。我们发现注意力分布与归因分布之间存在显著偏差,其由模型内部上下文混合所致。我们量化了该偏差并观察到,有趣的是,尽管存在混合,某些模式在所有层中持续存在。

关键词

引用

@article{arxiv.2004.05916,
  title  = {Telling BERT's full story: from Local Attention to Global Aggregation},
  author = {Damian Pascual and Gino Brunner and Roger Wattenhofer},
  journal= {arXiv preprint arXiv:2004.05916},
  year   = {2021}
}

备注

Accepted at EACL 2021