张量化自注意力:高效联合建模成对与全局依赖关系
计算与语言
2019-03-27 v4 人工智能
摘要
配备自注意力的神经网络具有可并行计算、轻量级结构以及捕获长程和局部依赖关系的能力。此外,通过使用向量来度量成对依赖关系,可以提升其表达能力和性能,但这需要将对齐矩阵扩展为张量,从而导致内存和计算瓶颈。在本文中,我们提出了一种名为“多掩码张量化自注意力”(MTSA)的新型注意力机制,它具有与 CNN 相当的速度和内存效率,但显著优于以往基于 CNN/RNN/注意力的模型。MTSA 1) 通过由点积注意力和加性注意力组成的新型兼容函数,捕获成对(token2token)和全局(source2token)依赖关系;2) 使用张量表示特征级对齐分数以获得更好的表达能力,但仅需可并行的矩阵乘法;3) 将多头与多维注意力相结合,并对每个头(子空间)应用独特的位置掩码,从而将内存和计算分配到多个头中,每个头独立编码序列信息。实验表明,基于 MTSA 的无 CNN/RNN 模型在九个 NLP 基准测试上取得了 SOTA 或极具竞争力的性能,同时具有出色的内存和时间效率。
引用
@article{arxiv.1805.00912,
title = {Tensorized Self-Attention: Efficiently Modeling Pairwise and Global Dependencies Together},
author = {Tao Shen and Tianyi Zhou and Guodong Long and Jing Jiang and Chengqi Zhang},
journal= {arXiv preprint arXiv:1805.00912},
year = {2019}
}