中文

DA-Transformer:距离感知 Transformer

计算与语言 2021-04-13 v2

摘要

Transformer 通过组合 BERT 和 GPT 等各类先进模型,已在 NLP 领域取得巨大成功。然而,Transformer 及其现有变体在捕捉词元距离方面可能并非最优,因为这些方法所使用的位置或距离嵌入通常无法保留真实距离的精确信息,这可能不利于对上下文的顺序与关系建模。本文中,我们提出 DA-Transformer,一种能够利用真实距离的距离感知 Transformer。我们提出将词元间的真实距离纳入以重新缩放由注意力查询与键的相关性计算得到的原始自注意力权重。具体而言,在不同的自注意力头中,每对词元的相对距离由不同的可学习参数加权,这些参数控制各头对长程或短程信息的不同偏好。由于原始加权真实距离可能并非调整自注意力权重的最优形式,我们提出一种可学习 sigmoid 函数将其映射为具有适当范围的重缩放系数。我们首先通过 ReLU 函数裁剪原始自注意力权重以保持非负性并引入稀疏性,然后将其与重缩放系数相乘,从而将真实距离信息编码进自注意力。在五个基准数据集上的大量实验表明,DA-Transformer 能有效提升许多任务的性能,并优于原始 Transformer 及其若干变体。

关键词

引用

@article{arxiv.2010.06925,
  title  = {DA-Transformer: Distance-aware Transformer},
  author = {Chuhan Wu and Fangzhao Wu and Yongfeng Huang},
  journal= {arXiv preprint arXiv:2010.06925},
  year   = {2021}
}

备注

To appear in NAACL 2021