头假设:一种理解 BERT 中多头注意力的统一统计方法
计算与语言
2021-01-25 v1 人工智能
摘要
多头注意力头是基于 transformer 的模型中的主力组件。已有多种方法基于具有较高成对注意力的词元间关系来对各个注意力头的作用进行分类。这些作用包括句法(具有某种句法关系的词元)、局部(邻近词元)、块(同一句子中的词元)以及分隔符(特殊的 [CLS]、[SEP] 词元)。现有分类方法面临两个主要挑战:(a)不同研究之间或不同功能作用之间缺乏标准分数;(b)这些分数往往是在句子上度量的平均量,未捕捉统计显著性。在本工作中,我们形式化了一个简单而有效的分数,它可推广到注意力头的所有作用,并对该分数进行假设检验以实现稳健推断。这为我们提供了恰当视角来系统分析注意力头,并自信地评论许多关于 BERT 模型分析的常见问题。具体而言,我们评论了多种功能作用在同一注意力头中的共置、注意力头在各层间的分布,以及针对特定 NLP 任务的微调对这些功能作用的影响。
引用
@article{arxiv.2101.09115,
title = {The heads hypothesis: A unifying statistical approach towards understanding multi-headed attention in BERT},
author = {Madhura Pande and Aakriti Budhraja and Preksha Nema and Pratyush Kumar and Mitesh M. Khapra},
journal= {arXiv preprint arXiv:2101.09115},
year = {2021}
}
备注
accepted at AAAI 2021 (Main conference)