通过解耦位置信息改进零样本翻译
计算与语言
2021-07-02 v2
摘要
多语言神经机器翻译已展现出直接翻译训练期间未见过的语言对(即零样本翻译)的能力。尽管在概念上颇具吸引力,但其输出质量往往较低。难以泛化到新的翻译方向表明,模型表征高度特定于训练中所见的语言对。我们证明,导致这种语言特定表征的一个主要因素是相对于输入词元的位置对应性。我们表明,这可以通过移除编码器层中的残差连接来轻松缓解。经过此修改,我们在零样本翻译上获得了高达 18.5 个 BLEU 点的提升,同时在监督翻译方向上保持质量。这些改进在相关语言之间尤为显著,我们提出的模型在此情形下优于基于枢轴的翻译。此外,我们的方法便于轻松集成新语言,从而大幅扩展翻译覆盖范围。通过对隐藏层输出的详尽检查,我们表明我们的方法确实带来了更具语言独立性的表征。
引用
@article{arxiv.2012.15127,
title = {Improving Zero-Shot Translation by Disentangling Positional Information},
author = {Danni Liu and Jan Niehues and James Cross and Francisco Guzmán and Xian Li},
journal= {arXiv preprint arXiv:2012.15127},
year = {2021}
}
备注
ACL 2021