Longformer:长文档 Transformer
计算与语言
2020-12-03 v2
摘要
基于 Transformer 的模型由于其自注意力操作随序列长度二次方增长,无法处理长序列。为应对此限制,我们引入了 Longformer,其注意力机制随序列长度线性增长,从而易于处理数千 token 或更长的文档。Longformer 的注意力机制是标准自注意力的直接替换,并将局部窗口注意力与任务驱动的全局注意力相结合。遵循先前关于长序列 transformer 的工作,我们在字符级语言建模上评估 Longformer,并在 text8 与 enwik8 上取得最先进(state-of-the-art)结果。与大多数先前工作不同,我们还预训练 Longformer 并在多种下游任务上微调它。我们的预训练 Longformer 在长文档任务上持续优于 RoBERTa,并在 WikiHop 与 TriviaQA 上树立新的最先进结果。我们最终引入了 Longformer-Encoder-Decoder (LED),一种支持长文档生成式序列到序列任务的 Longformer 变体,并展示了其在 arXiv 摘要数据集上的有效性。
关键词
引用
@article{arxiv.2004.05150,
title = {Longformer: The Long-Document Transformer},
author = {Iz Beltagy and Matthew E. Peters and Arman Cohan},
journal= {arXiv preprint arXiv:2004.05150},
year = {2020}
}
备注
Version 2 introduces the Longformer-Encoder-Decoder (LED) model