中文

用于机器翻译的英语-特威语平行语料库

计算与语言 2021-04-02 v3 人工智能

摘要

我们提出了一个包含 25,421 个句对的英语与阿夸佩姆特威语平行机器翻译训练语料库。我们使用基于 transformer 的翻译器生成阿夸佩姆特威语的初始翻译,随后由母语者进行验证并在必要时修正,以消除任何翻译腔的出现。此外,提供了 697 个更高质量的众包句子,用作下游自然语言处理(NLP)任务的评估集。较大规模人工验证数据集的典型用例是进一步训练阿夸佩姆特威语的机器翻译模型。建议将 697 个更高质量的众包数据集作为英语到特威语和特威语到英语模型机器翻译的测试数据集。此外,众包数据的特威语部分也可用于其他任务,例如表示学习、分类等。我们在训练语料库上微调 transformer 翻译模型,并报告在众包测试集上的基准结果。

关键词

引用

@article{arxiv.2103.15625,
  title  = {English-Twi Parallel Corpus for Machine Translation},
  author = {Paul Azunre and Salomey Osei and Salomey Addo and Lawrence Asamoah Adu-Gyamfi and Stephen Moore and Bernard Adabankah and Bernard Opoku and Clara Asare-Nyarko and Samuel Nyarko and Cynthia Amoaba and Esther Dansoa Appiah and Felix Akwerh and Richard Nii Lante Lawson and Joel Budu and Emmanuel Debrah and Nana Boateng and Wisdom Ofori and Edwin Buabeng-Munkoh and Franklin Adjei and Isaac Kojo Essel Ampomah and Joseph Otoo and Reindorf Borkor and Standylove Birago Mensah and Lucien Mensah and Mark Amoako Marcel and Anokye Acheampong Amponsah and James Ben Hayfron-Acquah},
  journal= {arXiv preprint arXiv:2103.15625},
  year   = {2021}
}

备注

9 pages paper, Accepted at African NLP workshop @EACL 2021