分段循环 Transformer:一种高效的序列到序列模型
计算与语言
2023-10-24 v3 人工智能
机器学习
摘要
Transformers 在包括语言和视觉在内的多个领域展现出主导性能。然而,其计算成本随序列长度呈二次增长,使其在资源受限的应用中难以使用。对此,我们的方法是将整个序列划分为段,并对各段分别施加注意力。我们提出一种分段循环 transformer(SRformer),将分段(局部)注意力与循环注意力相结合。因缩短注意力窗口长度带来的损失,通过循环注意力跨段聚合信息得以补偿。SRformer 利用循环累积触发(RAF)神经元的内在记忆来更新键与值的累积乘积。分段注意力与轻量级 RAF 神经元确保了所提 transformer 的高效性。该方法以更低的计算/内存成本获得具备序列处理能力的模型。我们将所提方法应用于 T5 和 BART transformers。修改后的模型在包括 CNN-dailymail、XSUM、ArXiv 和 MediaSUM 的摘要数据集上测试。值得注意的是,使用不同大小的分段输入,所提模型比分段 transformer 的 ROUGE1 分数高出 ,并优于其他循环 transformer 方法。此外,与全注意力相比,所提模型将交叉注意力的计算复杂度降低约 。
引用
@article{arxiv.2305.16340,
title = {Segmented Recurrent Transformer: An Efficient Sequence-to-Sequence Model},
author = {Yinghan Long and Sayeed Shafayet Chowdhury and Kaushik Roy},
journal= {arXiv preprint arXiv:2305.16340},
year = {2023}
}
备注
EMNLP 2023 Findings