基于动态词汇的多语言神经机器翻译中的迁移学习
计算与语言
2018-11-06 v1
摘要
我们提出一种通过共享动态词汇在神经机器翻译(NMT)模型间迁移知识的方法。我们的方法允许扩展给定语言对的初始模型以覆盖新语言,方法是根据其词汇表进行适配,只要新数据可用就引入新词汇项(即若其未包含在初始模型中则引入)。该参数迁移机制在两种场景中被评估:i) 使训练好的单语言 NMT 系统适配新语言对;ii) 持续添加新语言对以增长为多语言 NMT 系统。在这两种场景中,我们的目标是在最小化训练收敛时间的同时提升翻译性能。涵盖五种语言、不同训练数据规模(即 5k 和 50k 平行句)的初步实验显示,在不同语言方向上获得从 +3.85 到 +13.63 BLEU 的显著性能增益。此外,与从头训练 NMT 模型相比,我们的迁移学习方法允许我们在至多 4% 的总训练步数后达到更高性能。
引用
@article{arxiv.1811.01137,
title = {Transfer Learning in Multilingual Neural Machine Translation with Dynamic Vocabulary},
author = {Surafel M. Lakew and Aliia Erofeeva and Matteo Negri and Marcello Federico and Marco Turchi},
journal= {arXiv preprint arXiv:1811.01137},
year = {2018}
}
备注
Published at the International Workshop on Spoken Language Translation (IWSLT), 2018