中文

面向低资源神经机器翻译的众包基于短语的分词:以丰语为例

计算与语言 2021-03-18 v2 人工智能

摘要

为极低资源且形态丰富的非洲本土语言构建有效的神经机器翻译(NMT)模型是一项开放性挑战。除寻找可用资源的问题外,大量工作投入于预处理与分词。近期研究表明,标准分词方法并不总能充分处理某些非洲语言的语法、变音及声调特性。这一点加之训练样本极度匮乏,阻碍了可靠NMT模型的产出。在本文中,我们以丰语为案例,重审标准分词方法并引入基于词表达式(WEB)的分词,一种有人工参与的超词分词策略,以创建更具代表性的训练词表。此外,我们在丰语-法语与法语-丰语翻译任务上将其分词策略与其他方法进行比较。

关键词

引用

@article{arxiv.2103.08052,
  title  = {Crowdsourced Phrase-Based Tokenization for Low-Resourced Neural Machine Translation: The Case of Fon Language},
  author = {Bonaventure F. P. Dossou and Chris C. Emezue},
  journal= {arXiv preprint arXiv:2103.08052},
  year   = {2021}
}