EAG:抽取并生成多向对齐语料以实现完整多语言神经机器翻译
计算与语言
2024-07-23 v2 人工智能
摘要
完整多语言神经机器翻译(C-MNMT)通过构建多向对齐语料,即在源端或目标端相同时将不同语言对的双语训练样本对齐,相比传统 MNMT 取得了更优性能。然而,由于来自不同语言对的完全 identical 句子十分稀少,多向对齐语料的作用受其规模限制。为解决该问题,本文提出“抽取并生成”(EAG),一种从双语数据构建大规模高质量多向对齐语料的两步方法。具体而言,我们首先通过配对来自不同语言对、源句或目标句高度相似的双语样本来抽取候选对齐样本;然后利用训练良好的生成模型从候选样本中生成最终对齐样本。通过这一两步流程,EAG 可构建规模大且多向对齐的语料,其多样性几乎与原始双语语料一致。在 WMT-5 和 OPUS-100 两个公开数据集上的实验表明,所提方法相较强基线取得显著提升,在两个数据集上分别带来 +1.1 和 +1.4 BLEU 点的改进。
引用
@article{arxiv.2203.02180,
title = {EAG: Extract and Generate Multi-way Aligned Corpus for Complete Multi-lingual Neural Machine Translation},
author = {Yulin Xu and Zhen Yang and Fandong Meng and JieZhou},
journal= {arXiv preprint arXiv:2203.02180},
year = {2024}
}
备注
Accepted as a long paper at ACL 2022