用于快速且内存高效的序列建模的双向块自注意力
计算与语言
2018-04-04 v1 人工智能
摘要
循环神经网络 (RNN)、卷积神经网络 (CNN) 和自注意力网络 (SAN) 通常用于产生上下文感知表示。RNN 可以捕捉长程依赖,但难以并行化且时间效率低。CNN 专注于局部依赖,但在某些任务上表现不佳。SAN 可以通过高度可并行化的计算对这两种依赖进行建模,但内存需求随序列长度快速增长。在本文中,我们提出了一种名为“双向块自注意力网络”的模型,用于无 RNN/CNN 的序列编码。它所需内存与 RNN 一样少,但具备 SAN 的所有优点。Bi-BloSAN 将整个序列划分为块,对每个块应用块内 SAN 以建模局部上下文,然后对所有块的输出应用块间 SAN 以捕捉长程依赖。因此,每个 SAN 只需处理短序列,仅需少量内存。此外,我们使用特征级注意力来处理同一单词周围上下文的变化,并使用前向/后向掩码来编码时序信息。在用于不同 NLP 任务的九个基准数据集上,Bi-BloSAN 达到或改进了 SOTA 准确率,并显示出比现有 RNN/CNN/SAN 更好的效率-内存权衡。
引用
@article{arxiv.1804.00857,
title = {Bi-Directional Block Self-Attention for Fast and Memory-Efficient Sequence Modeling},
author = {Tao Shen and Tianyi Zhou and Guodong Long and Jing Jiang and Chengqi Zhang},
journal= {arXiv preprint arXiv:1804.00857},
year = {2018}
}
备注
18 pages, 7 figures; Accepted in ICLR-18