DiSAN:用于无RNN/CNN语言理解的有向自注意力网络
计算与语言
2017-11-22 v3 人工智能
摘要
循环神经网络(RNN)和卷积神经网络(CNN)分别广泛用于自然语言处理(NLP)任务中以捕捉长期和局部依赖关系。注意力机制近年来因其高度可并行计算、显著更短的训练时间以及建模依赖关系的灵活性而引起了极大关注。我们提出了一种新颖的注意力机制,其中来自输入序列的元素之间的注意力是有方向且多维的(即逐特征的)。随后提出了一种轻量级神经网络“有向自注意力网络(DiSAN)”,仅基于所提出的注意力而不使用任何RNN/CNN结构来学习句子嵌入。DiSAN仅由一个编码了时间顺序的有向自注意力,以及一个将序列压缩为向量表示的多维注意力组成。尽管形式简单,DiSAN在预测质量和时间效率上均优于复杂的RNN模型。它在所有句子编码方法中取得了最佳测试准确率,并在斯坦福自然语言推理(SNLI)数据集上将近期最佳结果提升了1.02%,同时在斯坦福情感树库(SST)、多类型自然语言推理(MultiNLI)、涉及组合知识的句子(SICK)、客户评论、MPQA、TREC问题类型分类和主观性(SUBJ)数据集上展示了最先进的测试准确率。
引用
@article{arxiv.1709.04696,
title = {DiSAN: Directional Self-Attention Network for RNN/CNN-Free Language Understanding},
author = {Tao Shen and Tianyi Zhou and Guodong Long and Jing Jiang and Shirui Pan and Chengqi Zhang},
journal= {arXiv preprint arXiv:1709.04696},
year = {2017}
}
备注
10 pages, 8 figures; Accepted in AAAI-18