利用子字符级信息的汉日无监督神经机器翻译
计算与语言
2019-03-04 v1
摘要
无监督神经机器翻译(UNMT)在训练时仅需相似语言对的单语数据,并能在字母文字语言上产生性能相对良好的双向翻译模型(Lample et al., 2018)。然而,目前尚无针对语素文字语言对的研究。本研究聚焦于通过包含子字符(表意文字或笔画)级信息的数据训练的汉日 UNMT,该信息由字符级数据分解得到。我们将字符级与子字符级系统的 BLEU 分数相互比较,结果表明尽管 UNMT 在字符级数据上有效,子字符级数据可进一步提升性能,其中笔画级系统优于表意文字级系统。
引用
@article{arxiv.1903.00149,
title = {Chinese-Japanese Unsupervised Neural Machine Translation Using Sub-character Level Information},
author = {Longtu Zhang and Mamoru Komachi},
journal= {arXiv preprint arXiv:1903.00149},
year = {2019}
}
备注
5 pages