Highway Transformer:自门控增强的自注意力网络
计算与语言
2020-11-25 v5 机器学习
摘要
自注意力机制在各种序列学习任务中取得了引人注目的当前最优(SOTA)进展,其基于多头点积注意力,关注不同位置的所有全局上下文。通过一条伪信息高速公路,我们引入了一种门控组件——自依赖单元(SDU),它结合LSTM风格的门控单元,以在个体表示的多维潜在空间内补充内部语义重要性。这种辅助的基于内容的SDU门允许经调制的潜在嵌入通过跳跃连接进行信息流动,从而以梯度下降算法带来明显的收敛速度优势。我们或可揭示门控机制在基于上下文的Transformer模块中的辅助作用,并假设SDU门(尤其在浅层)能在优化过程中更快地将模型推向次优点的步进取向。
引用
@article{arxiv.2004.08178,
title = {Highway Transformer: Self-Gating Enhanced Self-Attentive Networks},
author = {Yekun Chai and Shuo Jin and Xinwen Hou},
journal= {arXiv preprint arXiv:2004.08178},
year = {2020}
}
备注
Accepted at ACL 2020