基于语言特定嵌入的多语言神经机器翻译持续学习
计算与语言
2021-10-22 v1
摘要
本文提出一种技术,用于向已有的多语言 NMT 模型添加新源语言或目标语言,而无需在初始语言集合上重新训练。其做法是:以小规模语言特定词表替换共享词表,并在新语言的平行数据上微调新嵌入。可训练一些额外的语言特定组件以提升性能(例如 Transformer 层或适配器模块)。由于原始模型的参数未被修改,其在初始语言上的性能不会退化。我们在两组实验(TED Talks 上的小规模与 ParaCrawl 上的大规模)上表明,该方法表现与成本更高的替代方案相当或更好;并且其具备优异的零样本性能:在英语中心数据上训练即足以在新语言与该语言与任意初始语言之间互译。
引用
@article{arxiv.2110.10478,
title = {Continual Learning in Multilingual NMT via Language-Specific Embeddings},
author = {Alexandre Berard},
journal= {arXiv preprint arXiv:2110.10478},
year = {2021}
}
备注
Accepted as a research paper to WMT 2021