形态学注入在统计机器翻译中的作用
计算与语言
2017-09-19 v1
摘要
基于短语的统计模型更为常用,因为它们在翻译质量和系统复杂度方面均表现最优。印地语乃至所有印度语言通常在形态上比英语更为丰富。因此,尽管基于短语的系统在差异较小的语言对上表现良好,但在英语到印度语的翻译中,我们需要在源端获取更多语言学信息(如形态学、解析树、词性标注等)。在此情况下,因子模型似乎非常有用,因为因子模型将词视为由因子组成的向量。这些因子可以包含关于表层词的任何信息,并在翻译时加以利用。因此,本研究旨在利用因子翻译模型处理从英语翻译时的印地语和马拉地语形态变化。SMT 方法在翻译为形态丰富语言时会面临数据稀疏问题。平行语料库极不可能包含词汇的所有形态形式。我们提出一种解决方案,生成这些未见形态形式并将其注入原始训练语料库中。本文研究了因子模型以及向形态丰富语言翻译背景下的稀疏性问题。我们提出了一种简单有效的解决方案,其基于用词汇的各种形态形式丰富输入。我们观察到,形态学注入在充分性和流利度两方面均提升了翻译质量。我们通过从英语翻译为印地语和马拉地语这两种形态丰富语言的实验验证了这一点。
引用
@article{arxiv.1709.05487,
title = {Role of Morphology Injection in Statistical Machine Translation},
author = {Sreelekha S and Pushpak Bhattacharyya},
journal= {arXiv preprint arXiv:1709.05487},
year = {2017}
}
备注
36 pages, 12 figures, 15 tables, Modified version Published in: ACM Transactions on Asian and Low-Resource Language Information Processing (TALLIP) TALLIP Homepage archive Volume 17 Issue 1, September 2017 Issue-in-Progress,Article No. 1