中文

Lesan——面向低资源语言的机器翻译系统

计算与语言 2021-12-16 v1

摘要

全球数百万民众无法访问 Web 上的内容,因为大多数内容并非以其语言直接可用。机器翻译(MT)系统有潜力为许多语言改变这一现状。当前的 MT 系统对高资源语言对(如德语和英语)提供非常准确的结果。然而,对于许多低资源语言,MT 仍是活跃的研究方向。关键挑战在于缺乏构建这些系统的数据集。我们提出 Lesan,一个面向低资源语言的 MT 系统。我们的流水线通过利用在线与离线资源、针对埃塞俄比亚文字的定制 OCR 系统以及自动对齐模块,解决了低资源 MT 的关键瓶颈。流水线的最后一步是一个序列到序列模型,以平行语料为输入并给出翻译模型。Lesan 的翻译模型基于 Transformer 架构。在构建基础模型后,使用回译(back translation)来利用单语语料。目前 Lesan 支持提格里尼亚语、阿姆哈拉语与英语之间的互译。我们进行了广泛的人工评估,表明 Lesan 在所有六种语言对上均优于 Google Translate 和 Microsoft Translator 等最先进系统。Lesan 免费可用,迄今已服务超过 1000 万次翻译。目前仅有 217 篇提格里尼亚语和 15,009 篇阿姆哈拉语维基百科文章。我们相信 Lesan 将通过 MT 为数百万民众推进 Web 访问的民主化。

关键词

引用

@article{arxiv.2112.08191,
  title  = {Lesan -- Machine Translation for Low Resource Languages},
  author = {Asmelash Teka Hadgu and Abel Aregawi and Adam Beaudoin},
  journal= {arXiv preprint arXiv:2112.08191},
  year   = {2021}
}

备注

4 pages, 2 figures, 35th Conference on Neural Information Processing Systems (NeurIPS 2021) demonstrations track