Transformer 是否需要深层长程记忆
机器学习
2020-07-08 v1 计算与语言
机器学习
摘要
深度注意力模型在许多领域的序列数据建模方面取得了进展。特别是在语言建模中,Transformer-XL——一种增强了过去激活长程记忆的 Transformer——已被证明在多种充分研究的基准上达到最先进水平(SOTA)。Transformer-XL 在网络的每一层都引入了长程记忆,使其状态比 RNN 前身大数千倍。然而,目前尚不清楚这是否必要。我们执行了一系列干预实验,表明使用少 6 倍的长程记忆即可获得相当的性能,而通过限制网络较低层的注意力范围可获得更好的性能。
引用
@article{arxiv.2007.03356,
title = {Do Transformers Need Deep Long-Range Memory},
author = {Jack W. Rae and Ali Razavi},
journal= {arXiv preprint arXiv:2007.03356},
year = {2020}
}
备注
published at 58th Annual Meeting of the Association for Computational Linguistics. 6 pages, 4 figures, 1 table