中文

高效长程Transformer:需更多注意力,但不必在每一层

计算与语言 2023-10-20 v1 机器学习

摘要

预训练的Transformer模型已在各种自然语言处理任务中展现出卓越性能。这些模型利用注意力机制捕捉序列中的长程和短程依赖。然而,(全)注意力机制会带来高昂的计算成本——随序列长度呈二次方增长,这在长序列任务中难以承受,例如具有8k个词元的输入。尽管如现有工作所建议,可使用稀疏注意力来提高计算效率,但其建模能力有限,且常无法捕捉长序列中的复杂依赖。为应对这一挑战,我们提出了MASFormer,一种易于实现的混合注意力跨度Transformer变体。具体而言,MASFormer仅在少数层配备全注意力以捕捉长程依赖;其余层仅采用稀疏注意力捕捉短程依赖。我们在自然语言建模与生成任务上的实验表明,参数为1.3B的仅解码器MASFormer模型可在显著降低成本(高达75%)的同时,取得与全注意力原始Transformer相竞争的性能。此外,我们探究了利用长序列数据进行持续训练的有效性,以及序列长度如何影响下游生成性能,这本身或具独立意义。

关键词

引用

@article{arxiv.2310.12442,
  title  = {Efficient Long-Range Transformers: You Need to Attend More, but Not Necessarily at Every Layer},
  author = {Qingru Zhang and Dhananjay Ram and Cole Hawkins and Sheng Zha and Tuo Zhao},
  journal= {arXiv preprint arXiv:2310.12442},
  year   = {2023}
}

备注

The 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP 2023 Findings)