中文

LSG 注意力:将预训练 Transformer 外推至长序列

计算与语言 2022-10-28 v1

摘要

Transformer 模型在广泛的 NLP 任务上取得了最先进的性能。然而,由于自注意力机制,它们受到一个令人望而却步的限制,即相对于序列长度产生 O(n2)O(n^2) 的复杂度。为应对该限制,我们引入了依赖局部、稀疏和全局注意力的 LSG 架构。我们表明,LSG 注意力在长文档的分类与摘要任务中快速、高效且具有竞争力。有趣的是,它还可用于使现有预训练模型高效地外推至更长序列而无需额外训练。连同 LSG 注意力机制的引入,我们提出了基于该机制训练新模型及适配现有模型的工具。

关键词

引用

@article{arxiv.2210.15497,
  title  = {LSG Attention: Extrapolation of pretrained Transformers to long sequences},
  author = {Charles Condevaux and Sébastien Harispe},
  journal= {arXiv preprint arXiv:2210.15497},
  year   = {2022}
}