中文

论 Transformer 的长程能力

机器学习 2023-11-29 v1 计算与语言

摘要

尽管 Transformer 架构在现代深度学习(尤其是 NLP 领域)中占据主导地位,但与近期专门为此设计的层相比,其在长程任务上表现出次优性能。本工作中,受长程层(如状态空间层、线性 RNN 层以及全局卷积层)关键属性的启发,我们证明对 Transformer 架构的最小修改即可显著提升其在长程竞技场(LRA)基准上的性能,从而缩小与这些专用层之间的差距。我们确定长程任务的两个关键原则是(i)引入朝向平滑性的归纳偏置,以及(ii)局部性。如我们所展示的,将这些思想整合进注意力机制,能以可忽略的额外计算量和无任何额外可训练参数改善结果。我们的理论与实验也阐明了 Transformer 在长程任务上表现不佳的原因,并确定了成功捕捉长程依赖所必需的关键性质。

关键词

引用

@article{arxiv.2311.16620,
  title  = {On the Long Range Abilities of Transformers},
  author = {Itamar Zimerman and Lior Wolf},
  journal= {arXiv preprint arXiv:2311.16620},
  year   = {2023}
}

备注

18 pages