中文

将汉字部首融入神经机器翻译:深于字符级

计算与语言 2019-06-25 v3

摘要

在神经机器翻译(NMT)中,研究者面临未登录词(或称集外词 OOV)翻译的挑战。为此,一些研究者提出将英语、德语等西方语言切分为子词或复合词。本文中,我们试图以结构更为复杂的汉语解决此 OOV 问题,并通过不同设置将汉字部首整合进 NMT 模型,以改善汉英翻译中的 NMT 充分性。另一方面,这也可视为机器翻译系统的语义部分,因为汉字部首通常承载其所构成词语的基本含义。有意义的部首与新字可通过我们的模型整合进 NMT 系统。我们采用基于注意力的 NMT 系统作为强基线系统。在标准汉英 NIST 翻译共享任务数据 2006 与 2008 上的实验表明,我们设计的模型在包括 LEPOR、BEER、CharacTER 以及 BLEU 和 NIST 分数在内的广泛前沿评测指标上均优于基线模型,尤其在充分性层面的翻译上。我们还从多种实验设置的结果中关于汉语 NMT 词与字符的表现获得一些有趣发现,这不同于其他语言。例如,正如研究者近期所展示,全字符级 NMT 在其他一些语言中可能表现良好或达到最优,但在汉语 NMT 模型中,词边界知识对模型学习十分重要。

关键词

引用

@article{arxiv.1805.01565,
  title  = {Incorporating Chinese Radicals Into Neural Machine Translation: Deeper Than Character Level},
  author = {Lifeng Han and Shaohui Kuang},
  journal= {arXiv preprint arXiv:1805.01565},
  year   = {2019}
}

备注

In Proceedings of ESSLLI-2018: 30th European Summer School in Logic, Language and Information