中文

不再低资源:对齐器集成、批量过滤与孟加拉语-英语机器翻译新数据集

计算与语言 2020-10-08 v2

摘要

尽管孟加拉语是世界上使用人数第七多的语言,但由于资源匮乏,它在机器翻译文献中受到的关注要少得多。大多数公开可用的孟加拉语平行语料库规模不够大,且质量相当差,这主要源于错误的句子切分导致的句子对齐错误,以及其中存在的大量噪声。在这项工作中,我们为孟加拉语构建了一个定制的句子切分器,并提出了两种用于低资源环境下平行语料库构建的新方法:对齐器集成(aligner ensembling)和批量过滤(batch filtering)。结合该切分器与这两种方法,我们整理出了一个包含 275 万句对的高质量孟加拉语-英语平行语料库,其中超过 200 万句对此前不可用。在神经模型上训练,我们相比以往的孟加拉语-英语机器翻译方法取得了超过 9 个 BLEU 分数的提升。我们还在经过严格质量控制构建的 1000 句对新测试集上进行了评估。我们发布了该切分器、平行语料库和评估集,从而将孟加拉语从低资源状态中提升出来。据我们所知,这是首个关于孟加拉语-英语机器翻译的大规模研究。我们相信我们的研究将为未来孟加拉语-英语机器翻译以及其他低资源语言的研究铺平道路。我们的数据和代码可在 https://github.com/csebuetnlp/banglanmt 获取。

关键词

引用

@article{arxiv.2009.09359,
  title  = {Not Low-Resource Anymore: Aligner Ensembling, Batch Filtering, and New Datasets for Bengali-English Machine Translation},
  author = {Tahmid Hasan and Abhik Bhattacharjee and Kazi Samin and Masum Hasan and Madhusudan Basak and M. Sohel Rahman and Rifat Shahriyar},
  journal= {arXiv preprint arXiv:2009.09359},
  year   = {2020}
}

备注

EMNLP 2020