以部首作为附加输入特征改进字符级日中神经机器翻译
计算与语言
2018-05-09 v1
摘要
近年来,神经机器翻译(NMT)已被证明取得令人印象深刻的成果。尽管输入词的一些附加语言学特征改进了词级NMT,但迄今任何附加字符特征尚未被用于改进字符级NMT。本文中,我们表明汉字(或汉字/kanji)的部首作为一种字符特征信息,可轻易为字符级NMT提供进一步改进。在WAT2016日中科学论文节选语料库(ASPEC-JP)上的实验中,我们发现所提方法从困惑度和BLEU两方面改善了翻译质量。具有部首输入特征模型的字符级NMT在测试集上取得了40.61 BLEU点的state-of-the-art结果,较WAT2016日中翻译子任务(使用ASPEC-JP)上的最佳系统提高约8.6 BLEU点。相较于无附加输入特征的字符级NMT,在语料库的开发测试集和测试集上分别提高至多约1.5和1.4 BLEU点。
引用
@article{arxiv.1805.02937,
title = {Improving Character-level Japanese-Chinese Neural Machine Translation with Radicals as an Additional Input Feature},
author = {Jinyi Zhang and Tadahiro Matsumoto},
journal= {arXiv preprint arXiv:1805.02937},
year = {2018}
}
备注
4 pages,1 figure. IALP2017 accepted