中文

面向多语言与多领域神经机器翻译训练的不确定性感知平衡方法

计算与语言 2021-09-07 v1

摘要

学习多语言与多领域翻译模型具有挑战性,因为异构且不平衡的数据使得模型在真实世界的不同语料上收敛不一致。一种常见做法是调整训练中每个语料的比重,以使学习过程平衡,且低资源情形可受益于高资源情形。然而,自动平衡方法通常依赖于数据集内与数据集间的特征,而这通常是未知的或需要人工先验。本工作中,我们提出一种方法 MultiUAT,基于模型在一小组可信干净数据上的不确定性,动态调整多语料机器翻译的训练数据使用。我们在多语言(16 种语言,4 种设置)与多领域设置(英德翻译中 4 个领域内与 2 个领域外)上实验了两类不确定性度量,并证明我们的方法 MultiUAT 大幅优于其基线,包括静态与动态策略。我们分析了跨领域迁移,并展示了静态与基于相似度方法的不足。

关键词

引用

@article{arxiv.2109.02284,
  title  = {Uncertainty-Aware Balancing for Multilingual and Multi-Domain Neural Machine Translation Training},
  author = {Minghao Wu and Yitong Li and Meng Zhang and Liangyou Li and Gholamreza Haffari and Qun Liu},
  journal= {arXiv preprint arXiv:2109.02284},
  year   = {2021}
}

备注

15 pages, 4 figures, to appear at EMNLP 2021 main conference