中文

Big Bird:面向更长序列的 Transformer

机器学习 2021-01-11 v2 计算与语言 机器学习

摘要

基于 Transformer 的模型(如 BERT)已成为 NLP 中最成功的深度学习模型之一。遗憾的是,其核心局限之一是由于全注意力机制导致的对序列长度的二次依赖(主要在内存方面)。为此,我们提出 BigBird,一种将二次依赖降低为线性的稀疏注意力机制。我们证明 BigBird 是序列函数的通用逼近器且是图灵完备的,从而保留了二次全注意力模型的这些性质。在此过程中,我们的理论分析揭示了具有 O(1)O(1) 个全局 token(如 CLS)作为稀疏注意力机制一部分参与整个序列注意力的若干好处。所提出的稀疏注意力可处理的序列长度可达类似硬件下先前可能长度的 8 倍。由于能够处理更长上下文,BigBird 在问答和摘要等多种 NLP 任务上大幅提升了性能。我们还提出了在基因组学数据上的新应用。

关键词

引用

@article{arxiv.2007.14062,
  title  = {Big Bird: Transformers for Longer Sequences},
  author = {Manzil Zaheer and Guru Guruganesh and Avinava Dubey and Joshua Ainslie and Chris Alberti and Santiago Ontanon and Philip Pham and Anirudh Ravula and Qifan Wang and Li Yang and Amr Ahmed},
  journal= {arXiv preprint arXiv:2007.14062},
  year   = {2021}
}