零样本神经机器翻译中基于一致性的协议方法
机器学习
2019-04-11 v2 计算与语言
神经与进化计算
机器学习
摘要
多语言翻译的泛化能力与可靠性往往高度依赖于每个感兴趣语言对可用平行数据的规模。本文关注零样本泛化——一项具有挑战性的设定,它在训练时未优化的翻译方向上测试模型。为解决该问题,我们(i)将多语言翻译重新表述为概率推断,(ii)定义零样本一致性的概念并说明标准训练为何常导致不适合零样本任务的模型,以及(iii)引入一种基于一致协议的训练方法,鼓励模型对辅助语言中的平行句子产生等价翻译。我们在多个公开零样本翻译基准(IWSLT17、UN corpus、Europarl)上测试了我们的多语言 NMT 模型,并表明基于协议的学习相较强基线常带来 2-3 BLEU 的零样本提升,且在监督翻译方向上性能无任何损失。
引用
@article{arxiv.1904.02338,
title = {Consistency by Agreement in Zero-shot Neural Machine Translation},
author = {Maruan Al-Shedivat and Ankur P. Parikh},
journal= {arXiv preprint arXiv:1904.02338},
year = {2019}
}
备注
NAACL 2019 (14 pages, 5 figures)