神经网络中层的循环堆叠:在神经机器翻译中的应用
计算与语言
2021-06-21 v1
摘要
在深度神经网络建模中,最常见的做法是堆叠若干循环、卷积或前馈层,以获得高质量的连续空间表示,进而提升网络预测的质量。传统上,堆叠中的每一层都有自己的参数,这导致模型参数数量显著增加。在本文中,我们提出在所有层之间共享参数,从而得到循环堆叠的神经网络模型。我们报告了一项关于神经机器翻译(NMT)的广泛案例研究,将所提方法应用于基于编码器-解码器的神经网络模型即 Transformer 模型,并在三个日英翻译数据集上实验。我们凭经验证明,将单层循环堆叠 6 次的模型,尽管参数明显更少,其翻译质量接近堆叠 6 层且每层参数不同的模型。我们还探索了循环堆叠的极限,训练了极深的 NMT 模型。本文还通过迁移学习利用预训练参数和知识蒸馏,考察了我们所提循环堆叠模型作为学生模型的效用,并表明其弥补了直接训练循环堆叠模型带来的翻译质量下降。我们还展示了迁移学习如何在循环堆叠已减少参数数量的基础上实现更快解码。最后,我们通过可视化使用循环堆叠层与不使用循环堆叠层的模型的注意力,分析了循环堆叠层的影响。
引用
@article{arxiv.2106.10002,
title = {Recurrent Stacking of Layers in Neural Networks: An Application to Neural Machine Translation},
author = {Raj Dabre and Atsushi Fujita},
journal= {arXiv preprint arXiv:2106.10002},
year = {2021}
}
备注
22 pages. Under review. Work in progress. Extended version of https://ojs.aaai.org//index.php/AAAI/article/view/4590 which is an extension of arXiv:1807.05353 . The focus is on analyzing the limitations of recurrently stacked layers and methods to overcome said limitations