语言标记:一种极其简单的方法提升多语言翻译的零样本性能
计算与语言
2022-08-12 v1 机器学习
摘要
本文提出了一种简单而有效的方法,用于改善直接(X到Y)翻译在两种情形下的表现:零样本情形以及存在直接数据时的情形。我们修改编码器和解码器处的输入标记,以包含源语言和目标语言的信号。我们展示了在从头训练或使用所提设置微调预训练模型时的性能提升。在实验中,根据检查点选择标准,我们的方法在内部数据集上显示出近10.0个BLEU点的提升。在WMT评测中,从英语出发的翻译性能在零样本设定下提升4.17个BLEU点,在训练有可用直接数据时提升2.87个BLEU点。而X到Y翻译相较零样本基线提升1.29个BLEU点,相较多对多基线提升0.44个BLEU点。在低资源设定下,我们在X到Y领域数据上微调时看到1.5~1.7个点的提升。
引用
@article{arxiv.2208.05852,
title = {Language Tokens: A Frustratingly Simple Approach Improves Zero-Shot Performance of Multilingual Translation},
author = {Muhammad ElNokrashy and Amr Hendy and Mohamed Maher and Mohamed Afify and Hany Hassan Awadalla},
journal= {arXiv preprint arXiv:2208.05852},
year = {2022}
}
备注
10 pages, accepted at AMTA-2022 (Association for Machine Translation in the Americas Conference)