理解与改进序列到序列学习中的编码器层融合
计算与语言
2021-03-19 v2 机器学习
摘要
编码器层融合(EncoderFusion)是一种将序列到序列(Seq2Seq)模型的所有编码器层(而非最上层)进行融合的技术,已在各种 NLP 任务上被证明有效。然而,为何以及何时 EncoderFusion 应当生效仍不完全清楚。在本文中,我们的主要贡献是在理解 EncoderFusion 方面向前推进一步。许多先前的研究认为 EncoderFusion 的成功源于利用了嵌入在较低编码器层中的表层和句法信息。与他们不同,我们发现编码器嵌入层比其他中间编码器层更为重要。此外,最上层解码器层在各 NLP 任务中持续更多地关注编码器嵌入层。基于该观察,我们提出一种简单的融合方法 SurfaceFusion,仅将编码器嵌入层融合到 softmax 层。实验结果表明,SurfaceFusion 在多个 NLP 基准(包括机器翻译、文本摘要和语法错误纠正)上优于 EncoderFusion。它在 WMT16 罗马尼亚语-英语和 WMT14 英语-法语翻译任务上取得了最先进的性能。大量分析揭示,SurfaceFusion 通过构建相关源语言与目标语言嵌入之间更紧密的关系,学习到更具表达力的双语词嵌入。源代码可在 https://github.com/SunbowLiu/SurfaceFusion 免费获取。
引用
@article{arxiv.2012.14768,
title = {Understanding and Improving Encoder Layer Fusion in Sequence-to-Sequence Learning},
author = {Xuebo Liu and Longyue Wang and Derek F. Wong and Liang Ding and Lidia S. Chao and Zhaopeng Tu},
journal= {arXiv preprint arXiv:2012.14768},
year = {2021}
}
备注
Accepted to ICLR 2021