记忆 Transformer
计算与语言
2021-02-17 v2 机器学习
神经与进化计算
摘要
基于 Transformer 的模型已在许多自然语言处理任务中取得最先进的结果。自注意力架构允许 Transformer 将序列中所有元素的信息组合为上下文感知的表示。然而,关于上下文的信息主要存储于相同的逐元素表示中。这可能使处理与整个序列相关的属性变得更加困难。添加可训练记忆以选择性地存储序列的局部与全局表示,是改进 Transformer 模型的一个有前景的方向。记忆增强神经网络(MANNs)通过通用记忆扩展传统神经架构以存储表示。MANNs 已展示出学习复制(Copy)或反转(Reverse)等简单算法的能力,并且可以通过反向传播在从问答到语言建模的多种任务上成功训练,其性能优于复杂度相当的 RNNs 和 LSTMs。在本工作中,我们提出并研究了 Transformer 基线的若干扩展:(1) 通过添加记忆令牌存储非局部表示,(2) 为全局信息创建记忆瓶颈,(3) 用专用层控制记忆更新。我们评估了这些记忆增强的 Transformers,并证明记忆的存在与机器翻译和语言建模任务的模型性能呈正相关。用记忆令牌增强预训练掩码语言模型在 GLUE 基准任务上显示出混合结果。对记忆上注意力模式的可视化表明,它提升了模型处理全局上下文的能力。
引用
@article{arxiv.2006.11527,
title = {Memory Transformer},
author = {Mikhail S. Burtsev and Yuri Kuratov and Anton Peganov and Grigory V. Sapunov},
journal= {arXiv preprint arXiv:2006.11527},
year = {2021}
}