卷积自注意力网络
计算与语言
2019-04-08 v1 人工智能
摘要
自注意力网络(SANs)因其在计算上的高度并行性以及建模依赖关系的灵活性而受到越来越多的关注。通过允许多头注意力使模型关注不同表示子空间的信息,可进一步增强 SANs。本文中,我们提出新颖的卷积自注意力网络,其赋予 SANs 以下能力:1)增强相邻元素间的依赖关系;2)建模由多个注意力头提取的特征间的交互。在不同语言对与模型设定下的机器翻译实验结果表明,我们的方法在增强 SANs 局部性方面优于强 Transformer 基线及其他现有模型。与先前研究相比,所提模型在引入更多参数方面是无参数的。
引用
@article{arxiv.1904.03107,
title = {Convolutional Self-Attention Networks},
author = {Baosong Yang and Longyue Wang and Derek Wong and Lidia S. Chao and Zhaopeng Tu},
journal= {arXiv preprint arXiv:1904.03107},
year = {2019}
}
备注
NAACL 2019