探究高效扩展Transformer以处理长输入摘要任务
计算与语言
2022-08-10 v1
摘要
尽管大型预训练Transformer模型已被证明在处理自然语言任务方面能力很强,但处理长序列输入仍然是一个重大挑战。长输入摘要就是这样一项任务,其输入长度超过了大多数预训练模型的最大输入上下文。通过大量实验,我们研究了哪些模型架构改变和预训练范式能够最有效地将预训练Transformer适配于长输入摘要。我们发现,带有全局编码器token的交错式块局部Transformer在性能和效率之间取得了良好平衡,并且在长序列上进行额外的预训练阶段能显著提升下游摘要性能。基于我们的发现,我们提出了PEGASUS-X,它是PEGASUS模型的扩展,增加了长输入预训练以处理长达16K token的输入。PEGASUS-X在长输入摘要任务上取得了与更大规模模型相当的强劲性能,同时仅增加了极少额外参数且训练时不需要模型并行。
引用
@article{arxiv.2208.04347,
title = {Investigating Efficiently Extending Transformers for Long Input Summarization},
author = {Jason Phang and Yao Zhao and Peter J. Liu},
journal= {arXiv preprint arXiv:2208.04347},
year = {2022}
}