中文

神经机器翻译中目标端形态建模:策略比较

计算与语言 2022-03-28 v1

摘要

形态丰富语言给机器翻译带来困难。依赖平行训练数据统计分析的机器翻译引擎,例如当前最优的神经机器翻译系统,尤其在处理输出语言端丰富形态时面临挑战。数据驱动机器翻译中目标端丰富形态的主要挑战包括:(1) 大量不同屈折的词语表层形式导致更大的词表,从而引发数据稀疏性。(2) 一些低频词的屈折形式通常未出现在训练语料中,这使得封闭词表系统无法生成这些未观测到的变体。(3) 语言一致性要求系统正确匹配输出句中屈折词形之间的语法范畴,既需满足目标端形态句法合法性,又需在语义上贴合输入。本文重新考察两种目标端语言处理技术:词元-标记(lemma-tag)策略与语言学启发的分词策略。我们在不同规模的三个训练语料条件下开展英德翻译任务实验。我们发现,较强的 Transformer 基线相比浅层 RNN 编码器-解码器模型在域内翻译时改进空间更小。然而,我们发现当同一系统应用于域外输入文本时,目标端形态的语言学建模确实有益于 Transformer 模型。我们还成功将该方法应用于英语到捷克语翻译。

关键词

引用

@article{arxiv.2203.13550,
  title  = {Modeling Target-Side Morphology in Neural Machine Translation: A Comparison of Strategies},
  author = {Marion Weller-Di Marco and Matthias Huck and Alexander Fraser},
  journal= {arXiv preprint arXiv:2203.13550},
  year   = {2022}
}