中文

LongT5:面向长序列的高效文本到文本 Transformer

计算与语言 2022-05-04 v2

摘要

近期研究表明,要么(1)增加输入长度,要么(2)增大模型规模,均可提升基于 Transformer 的神经模型性能。本文中,我们提出一种称为 LongT5 的新模型,借此同时探究扩大输入长度与模型规模的影响。具体而言,我们将来自长输入 Transformer(ETC)的注意力思想,以及来自摘要预训练(PEGASUS)的预训练策略,整合进可扩展的 T5 架构中。由此产生一种我们称之为瞬态全局(Transient Global,TGlobal)的新注意力机制,其模拟 ETC 的局部/全局注意力机制,但无需额外的侧输入。我们能在若干摘要任务上取得最先进结果,并在问答任务上超越原始 T5 模型。

关键词

引用

@article{arxiv.2112.07916,
  title  = {LongT5: Efficient Text-To-Text Transformer for Long Sequences},
  author = {Mandy Guo and Joshua Ainslie and David Uthus and Santiago Ontanon and Jianmo Ni and Yun-Hsuan Sung and Yinfei Yang},
  journal= {arXiv preprint arXiv:2112.07916},
  year   = {2022}
}

备注

Accepted in NAACL 2022