中文

面向低资源翻译的广义数据增强

计算与语言 2019-06-11 v1

摘要

与低资源语言(LRLs)互译在充分性和流畅性方面对机器翻译提出了挑战。利用大量单语数据的数据增强被视为缓解这些问题的有效方法。本文提出一种用于低资源机器翻译数据增强的通用框架,该框架不仅使用目标端单语数据,还通过相关的资源丰富语言(HRL)进行中转。具体而言,我们实验了一种两步中转方法,将资源丰富语言数据转换为低资源语言,利用可用资源更好地近似低资源语言的真实数据分布。首先,我们通过归纳出的双语词典将低资源语言词注入资源丰富语言句子。其次,我们使用改进的无监督机器翻译框架进一步编辑这些修改后的句子。在四个低资源数据集上的大量实验表明,在极端低资源设置下,与有监督反向翻译基线相比,我们的数据增强技术将翻译质量提高了最多约 1.5 至约 8 个 BLEU 点。

关键词

引用

@article{arxiv.1906.03785,
  title  = {Generalized Data Augmentation for Low-Resource Translation},
  author = {Mengzhou Xia and Xiang Kong and Antonios Anastasopoulos and Graham Neubig},
  journal= {arXiv preprint arXiv:1906.03785},
  year   = {2019}
}

备注

Accepted to ACL 2019