用于神经机器翻译的码切换预训练
计算与语言
2020-09-18 v1
摘要
本文提出一种用于神经机器翻译(NMT)的新的预训练方法,简称码切换预训练(CSP)。与随机掩码输入句子中某些片段的传统预训练方法不同,所提 CSP 随机将源句中的一些词替换为其目标语言中的翻译词。具体地,我们首先通过源语言与目标语言间的无监督词嵌入映射进行词典归纳,然后根据提取的翻译词典随机将输入句中的一些词替换为其翻译词。CSP 采用编码器-解码器框架:其编码器以码混合句子为输入,解码器预测输入句中被替换的片段。通过这种方式,CSP 能够通过显式地充分利用从源端与目标端单语语料中提取的跨语言对齐信息来预训练 NMT 模型。此外,我们缓解了由 [mask] 等人工符号引起的预训练-微调不一致问题。为验证所提方法的有效性,我们在无监督与有监督 NMT 上进行了大量实验。实验结果表明,相较于无预训练或其他预训练方法的基线,CSP 取得了显著改进。
引用
@article{arxiv.2009.08088,
title = {Code-switching pre-training for neural machine translation},
author = {Zhen Yang and Bojie Hu and Ambyera Han and Shen Huang and Qi Ju},
journal= {arXiv preprint arXiv:2009.08088},
year = {2020}
}
备注
10 pages, EMNLP2020 main conference