BitextEdit:面向低资源机器翻译的自动双语文本编辑方法
计算与语言
2022-06-01 v2
摘要
挖掘得到的双语文本可能包含不完美的翻译,从而为神经机器翻译(NMT)提供不可靠的训练信号。尽管已知过滤掉此类句对可提升最终模型质量,我们认为在低资源条件下这并非最优,因为即便挖掘得到的数据也可能十分有限。在我们的工作中,我们提出通过自动编辑来精炼挖掘得到的双语文本:给定语言 xf 中的一个句子及其可能不完美的翻译 xe,我们的模型生成修订版本 xf' 或 xe',从而得到更对等的翻译句对(即 <xf, xe'> 或 <xf', xe>)。我们采用一种简单的编辑策略:(1)为给定双语文本中每个句子挖掘潜在不完美的翻译,(2)以多任务方式学习一个模型来重建原始翻译并进行翻译。实验表明,我们的方法成功地将 CCMatrix 挖掘双语文本的质量在 5 个低资源语言对和 10 个翻译方向上提升了最高约 8 个 BLEU 点,且在多数情况下优于一个具有竞争力的反向翻译基线。
引用
@article{arxiv.2111.06787,
title = {BitextEdit: Automatic Bitext Editing for Improved Low-Resource Machine Translation},
author = {Eleftheria Briakou and Sida I. Wang and Luke Zettlemoyer and Marjan Ghazvininejad},
journal= {arXiv preprint arXiv:2111.06787},
year = {2022}
}