面向神经机器翻译的形态学与语言无关的词分割
计算与语言
2018-06-15 v1
摘要
在处理神经机器翻译(NMT)中丰富形态时的前沿方法是将词形切分为子词单元,从而使这些单元的总体词汇量符合 NMT 模型和 GPU 内存容量所给出的实际限制。在本文中,我们比较了两种常见但语言学上无依据的亚词构建方法(BPE 和 STE,即 Tensor2Tensor 工具包中实现的方法)以及两种受语言学驱动的方法:Morfessor 和一种基于派生词典的新方法。我们以德语到捷克语翻译(两者均形态丰富)进行的实验表明,迄今为止,无依据的方法表现更好。此外,我们指出了 BPE 与 STE 之间的关键差异,并展示了一种简单的 BPE 预处理步骤,可通过自动度量显著提高翻译质量。
引用
@article{arxiv.1806.05482,
title = {Morphological and Language-Agnostic Word Segmentation for NMT},
author = {Dominik Macháček and Jonáš Vidra and Ondřej Bojar},
journal= {arXiv preprint arXiv:1806.05482},
year = {2018}
}
备注
In print. To appear in TSD 2018