改进基于语言特定编码器-解码器的零样本神经机器翻译
计算与语言
2021-02-15 v1
摘要
近年来,具有共享编码器-解码器的通用神经机器翻译(NMT)在零样本翻译上取得了良好性能。与通用 NMT 不同,联合训练的语言特定编码器-解码器旨在跨非共享模块实现通用表示,其中每个模块对应一种语言或语系。非共享架构具有缓解内部语言竞争的优势,尤其在共享词表与模型参数规模受限时。然而,在多编码器-解码器上进行零样本翻译的性能仍落后于通用 NMT。本文研究使用语言特定编码器-解码器的零样本翻译。我们提出通过区分 Transformer 层中语言特定层与中间语言层,来泛化非共享架构与通用 NMT。通过选择性共享参数并应用交叉注意力,我们探索最大化表示通用性并实现语言无关信息的最佳对齐。我们还引入去噪自编码(DAE)目标,以多任务方式与翻译任务联合训练模型。在两个公开多语言平行数据集上的实验表明,我们提出的模型取得了与通用 NMT 和强枢轴基线相当或更好的结果。此外,我们通过仅更新新模型参数,增量式地向训练好的模型添加新语言。以极小的代价,该新添语言与已有语言间的零样本翻译取得了与从头联合训练所有语言的模型相当的结果。
引用
@article{arxiv.2102.06578,
title = {Improving Zero-shot Neural Machine Translation on Language-specific Encoders-Decoders},
author = {Junwei Liao and Yu Shi and Ming Gong and Linjun Shou and Hong Qu and Michael Zeng},
journal= {arXiv preprint arXiv:2102.06578},
year = {2021}
}