注意力可以反映句法结构(如果你允许的话)
计算与语言
2021-01-27 v1
摘要
自 Transformer 作为 NLP 通用特征编码器流行以来,许多研究试图从其新颖的多头注意力机制中解码语言结构。然而,此类工作大多几乎只关注英语——一种词序严格且缺乏屈折形态的语言。在本研究中,我们针对多语言 BERT(mBERT)在18种语言上进行了解码实验,以检验“依存句法反映在注意力模式中”这一主张的普适性。我们表明,完整的句法树可以从单一注意力头中以高于基线的准确率被解码,且个体关系常由跨语言相同的头所追踪。此外,为回应近期关于注意力作为解释性机制地位的争论,我们尝试在冻结不同参数系列的同时,以监督句法分析目标对 mBERT 进行微调。有趣的是,在引导该目标学习显式语言结构时,我们发现所得注意力模式中呈现了诸多相同的结构,且在冻结哪些参数方面存在有趣差异。
引用
@article{arxiv.2101.10927,
title = {Attention Can Reflect Syntactic Structure (If You Let It)},
author = {Vinit Ravishankar and Artur Kulmizev and Mostafa Abdou and Anders Søgaard and Joakim Nivre},
journal= {arXiv preprint arXiv:2101.10927},
year = {2021}
}