GMAT: 面向 Transformer 的全局记忆增强
机器学习
2020-06-08 v1 计算与语言
机器学习
摘要
基于 Transformer 的模型因其大容量、天然并行性和高性能而在自然语言处理中变得无处不在。Transformer 块的语境化组件是成对点积注意力,其对长度为 的序列具有 的大内存需求,限制了其处理长文档的能力。这近来成为大量关注的主题,其中提出了多种近似方法以使用稀疏注意力矩阵来降低二次内存需求。在这项工作中,我们提出用长度为 ()的基于稠密注意力的全局记忆来增强稀疏 Transformer 块,该记忆为每个位置提供对整个输入序列的聚合全局视图。我们的增强具有可管理的 内存开销,并且可以与先前的稀疏解决方案无缝集成。此外,全局记忆也可用于序列压缩,仅用记忆表示来代表长输入序列。我们通过实验表明,我们的方法在一系列任务上带来了实质性改进,包括 (a) 需要全局推理的合成任务,(b) 掩码语言建模,以及 (c) 阅读理解。
引用
@article{arxiv.2006.03274,
title = {GMAT: Global Memory Augmentation for Transformers},
author = {Ankit Gupta and Jonathan Berant},
journal= {arXiv preprint arXiv:2006.03274},
year = {2020}
}