基于双语词典的语言模型预训练用于神经机器翻译
计算与语言
2021-03-15 v1 人工智能
机器学习
摘要
近期研究表明,应用跨语言语言模型预训练(Lample and Conneau, 2019),尤其是翻译语言建模(TLM),可显著提升神经机器翻译性能。为缓解 TLM 对昂贵平行语料的依赖,本文将对词典中翻译信息的利用引入预训练过程,提出一种新颖的基于双语词典的语言模型(BDLM)。我们在中文、英文与罗马尼亚文上评估 BDLM。对于中英翻译,我们在 WMT-News19(Tiedemann, 2012)上取得 55.0 BLEU,在 WMT20 news-commentary 上取得 24.3 BLEU,分别超越 Vanilla Transformer(Vaswani et al., 2017)8.4 BLEU 与 2.3 BLEU 以上。据我们的结果,BDLM 在收敛速度与罕见词预测上亦具优势。WMT16 罗马尼亚-英翻译中 BLEU 的提升亦显示其在低资源语言翻译上的有效性。
引用
@article{arxiv.2103.07040,
title = {Bilingual Dictionary-based Language Model Pretraining for Neural Machine Translation},
author = {Yusen Lin and Jiayong Lin and Shuaicheng Zhang and Haoying Dai},
journal= {arXiv preprint arXiv:2103.07040},
year = {2021}
}