中文

大规模多语言神经机器翻译表征研究

计算与语言 2019-09-13 v2 机器学习

摘要

多语言神经机器翻译(NMT)模型在迁移学习设定中取得了巨大的经验性成功。然而,这些黑盒表征鲜被理解,其迁移机制仍不明了。在本文中,我们尝试使用奇异值典型相关分析(SVCCA)——一种允许我们比较不同语言、层和模型间表征的表征相似性框架——来理解大规模多语言NMT表征(含103种语言)。我们的分析验证了若干经验性结果和长期直觉,并揭示了关于表征在多语言翻译模型中如何演化的新观察。我们从分析中得出三个主要结论,对跨语言迁移学习具有启示:(i)不同语言的编码器表征基于语言相似性聚类,(ii)编码器习得的一种源语言表征依赖于目标语言,反之亦然,以及(iii)高资源且/或语言相似语言的表征在针对任意语言对微调时更为鲁棒,这对确定在零样本或少样本设定下可预期的跨语言迁移程度至关重要。我们进一步将我们的发现与多语言NMT和迁移学习中已有的经验观察相联系。

关键词

引用

@article{arxiv.1909.02197,
  title  = {Investigating Multilingual NMT Representations at Scale},
  author = {Sneha Reddy Kudugunta and Ankur Bapna and Isaac Caswell and Naveen Arivazhagan and Orhan Firat},
  journal= {arXiv preprint arXiv:1909.02197},
  year   = {2019}
}

备注

Paper at EMNLP 2019