探究层归一化对零样本神经机器翻译的影响
计算与语言
2023-05-17 v1
摘要
本文研究了层归一化(LayerNorm)对零样本翻译(ZST)的影响。近期 ZST 的研究通常以 Transformer 架构为骨干,并默认在层输入处设置 LayerNorm(PreNorm)。然而,Xu 等人(2019)已揭示 PreNorm 存在过拟合训练数据的风险。基于此,我们假设 PreNorm 可能过拟合监督方向,从而对 ZST 的泛化能力较低。通过在 OPUS、IWSLT 和 Europarl 数据集上对 54 个 ZST 方向进行实验,我们证明残差连接后设置 LayerNorm 的原始 Transformer 配置(PostNorm)始终优于 PreNorm,最高可达 12.3 个 BLEU 点。随后,我们通过分析 PreNorm 与 PostNorm 在离目标率与结构差异上的不同来研究性能差异。本研究强调了在 ZST 中需谨慎考虑 LayerNorm 设置的必要性。
引用
@article{arxiv.2305.09312,
title = {Exploring the Impact of Layer Normalization for Zero-shot Neural Machine Translation},
author = {Zhuoyuan Mao and Raj Dabre and Qianying Liu and Haiyue Song and Chenhui Chu and Sadao Kurohashi},
journal= {arXiv preprint arXiv:2305.09312},
year = {2023}
}
备注
Accepted to ACL 2023 main conference