基于跨语言数据选择的神经机器翻译广义无监督领域自适应
计算与语言
2021-09-10 v1
摘要
本文考虑神经机器翻译(NMT)的无监督领域自适应问题,在此我们假设在新领域中仅能获取源语言或目标语言的单语文本。我们提出了一种跨语言数据选择方法,从大型通用单语语料库中提取缺失语言端的领域内句子。我们提出的方法通过对比学习在多语言 BERT 之上训练一个自适应层,以对齐源语言和目标语言之间的表示。这使得领域分类器能够以零样本的方式在不同语言之间进行迁移。一旦分类器检测到领域内数据,NMT 模型便通过联合学习翻译和领域判别任务来适应新领域。我们在三个语言对的五个不同领域的 NMT 上评估了我们的跨语言数据选择方法,以及一个 COVID-19 翻译的真实场景。结果表明,我们提出的方法优于其他选择基线,BLEU 分数最高提升 +1.5。
引用
@article{arxiv.2109.04292,
title = {Generalised Unsupervised Domain Adaptation of Neural Machine Translation with Cross-Lingual Data Selection},
author = {Thuy-Trang Vu and Xuanli He and Dinh Phung and Gholamreza Haffari},
journal= {arXiv preprint arXiv:2109.04292},
year = {2021}
}
备注
EMNLP2021