掩码注意力网络:重新思考并增强 Transformer
计算与语言
2021-03-26 v1
摘要
Transformer 是一种基于注意力的神经网络,由两个子层组成,即自注意力网络(SAN)与前馈网络(FFN)。已有研究分别探索增强这两个子层,以提升 Transformer 在文本表示上的能力。本文提出一种将 SAN 与 FFN 理解为掩码注意力网络(MANs)的新视角,并表明它们是具有静态掩码矩阵的 MANs 的两个特例。然而,其静态掩码矩阵限制了文本表示学习中局部性建模的能力。因此我们引入一种具有可学习掩码矩阵的新层,即动态掩码注意力网络(DMAN),能够自适应地建模局部性。为结合 DMAN、SAN 与 FFN 的优势,我们提出一种顺序层叠结构以组合这三种层。在包括神经机器翻译与文本摘要在内的多种任务上的大量实验表明,我们的模型优于原始 Transformer。
引用
@article{arxiv.2103.13597,
title = {Mask Attention Networks: Rethinking and Strengthen Transformer},
author = {Zhihao Fan and Yeyun Gong and Dayiheng Liu and Zhongyu Wei and Siyuan Wang and Jian Jiao and Nan Duan and Ruofei Zhang and Xuanjing Huang},
journal= {arXiv preprint arXiv:2103.13597},
year = {2021}
}
备注
Accepted as a long paper to NAACL 2021