中文

自注意力层何时可被前馈层替代?

音频与语音处理 2020-05-29 v1 计算与语言 声音

摘要

近来,诸如Transformer之类的自注意力模型在语音识别中相比循环神经网络系统给出了有竞争力的结果。自注意力模型出色性能的关键因素是它们能够捕捉时间关系而不受两个相关事件之间距离的限制。然而,我们注意到所学上下文的范围从较低到较高的自注意力层逐步增大,而声学事件常以从左到右的顺序在短时间跨度内发生。这引出一个问题:对于语音识别,全局查看整个序列对Transformer编码器中较高的自注意力层是否仍然重要?为研究此问题,我们将这些自注意力层替换为前馈层。在我们的语音识别实验(Wall Street Journal和Switchboard)中,我们确实观察到一个有趣的结果:将编码器中较高的自注意力层替换为前馈层不会导致性能下降,甚至略有提升。我们的实验揭示了自注意力层如何处理语音信号,并得出如下结论:编码器中较低的自注意力层已编码了足够宽范围的输入,因此在较高层中学习进一步的上下文信息是不必要的。

关键词

引用

@article{arxiv.2005.13895,
  title  = {When Can Self-Attention Be Replaced by Feed Forward Layers?},
  author = {Shucong Zhang and Erfan Loweimi and Peter Bell and Steve Renals},
  journal= {arXiv preprint arXiv:2005.13895},
  year   = {2020}
}