将汉字部首融入神经机器翻译:深于字符级
计算与语言
2019-06-25 v3
摘要
在神经机器翻译(NMT)中,研究者面临未登录词(或称集外词 OOV)翻译的挑战。为此,一些研究者提出将英语、德语等西方语言切分为子词或复合词。本文中,我们试图以结构更为复杂的汉语解决此 OOV 问题,并通过不同设置将汉字部首整合进 NMT 模型,以改善汉英翻译中的 NMT 充分性。另一方面,这也可视为机器翻译系统的语义部分,因为汉字部首通常承载其所构成词语的基本含义。有意义的部首与新字可通过我们的模型整合进 NMT 系统。我们采用基于注意力的 NMT 系统作为强基线系统。在标准汉英 NIST 翻译共享任务数据 2006 与 2008 上的实验表明,我们设计的模型在包括 LEPOR、BEER、CharacTER 以及 BLEU 和 NIST 分数在内的广泛前沿评测指标上均优于基线模型,尤其在充分性层面的翻译上。我们还从多种实验设置的结果中关于汉语 NMT 词与字符的表现获得一些有趣发现,这不同于其他语言。例如,正如研究者近期所展示,全字符级 NMT 在其他一些语言中可能表现良好或达到最优,但在汉语 NMT 模型中,词边界知识对模型学习十分重要。
引用
@article{arxiv.1805.01565,
title = {Incorporating Chinese Radicals Into Neural Machine Translation: Deeper Than Character Level},
author = {Lifeng Han and Shaohui Kuang},
journal= {arXiv preprint arXiv:1805.01565},
year = {2019}
}
备注
In Proceedings of ESSLLI-2018: 30th European Summer School in Logic, Language and Information