中文

论局部信息在基于 Transformer 模型中的重要性

计算与语言 2020-08-14 v1 机器学习

摘要

自注意力模块是基于 Transformer 模型的关键组件,其中每个词元都关注其他所有词元。近期研究表明这些注意力头表现出句法、语义或局部行为。一些研究也发现将此种注意力限制为局部(即一个词元仅关注其周围小邻域内的其他词元)具有前景。然而,尚无确凿证据表明仅这样的局部注意力足以在多个 NLP 任务上取得高准确率。在本工作中,我们系统分析了局部信息在已学习模型中的作用,并将其与句法信息的作用进行对比。更具体地,我们首先进行敏感性分析,表明在每一层,一个词元的表示对其周围小邻域内词元的敏感度远高于对与其句法相关词元的敏感度。我们随后定义一种注意力偏置度量,以确定一个注意力头是更关注局部词元还是句法相关词元。我们展示具有局部偏置的注意力头比例大于具有句法偏置的比例。在确立局部注意力头的重要性后,我们训练并评估了将不同比例的注意力头约束为局部的模型。此类模型将更高效,因其注意力层中的计算更少。我们在 4 个 GLUE 数据集(QQP、SST-2、MRPC、QNLI)与 2 个 MT 数据集(En-De、En-Ru)上评估这些模型,并清晰表明此类约束模型具有与无约束模型相当的性能。通过这一系统评估,我们确立基于 Transformer 模型中的注意力可被约束为局部而不影响性能。

关键词

引用

@article{arxiv.2008.05828,
  title  = {On the Importance of Local Information in Transformer Based Models},
  author = {Madhura Pande and Aakriti Budhraja and Preksha Nema and Pratyush Kumar and Mitesh M. Khapra},
  journal= {arXiv preprint arXiv:2008.05828},
  year   = {2020}
}

备注

10 pages, 4 figures