中文

面向神经机器翻译的形态学与语言无关的词分割

计算与语言 2018-06-15 v1

摘要

在处理神经机器翻译(NMT)中丰富形态时的前沿方法是将词形切分为子词单元,从而使这些单元的总体词汇量符合 NMT 模型和 GPU 内存容量所给出的实际限制。在本文中,我们比较了两种常见但语言学上无依据的亚词构建方法(BPE 和 STE,即 Tensor2Tensor 工具包中实现的方法)以及两种受语言学驱动的方法:Morfessor 和一种基于派生词典的新方法。我们以德语到捷克语翻译(两者均形态丰富)进行的实验表明,迄今为止,无依据的方法表现更好。此外,我们指出了 BPE 与 STE 之间的关键差异,并展示了一种简单的 BPE 预处理步骤,可通过自动度量显著提高翻译质量。

关键词

引用

@article{arxiv.1806.05482,
  title  = {Morphological and Language-Agnostic Word Segmentation for NMT},
  author = {Dominik Macháček and Jonáš Vidra and Ondřej Bojar},
  journal= {arXiv preprint arXiv:1806.05482},
  year   = {2018}
}

备注

In print. To appear in TSD 2018