面向马拉地语和印地语统计机器翻译的双语词与短语映射
计算与语言
2017-11-13 v3
摘要
缺乏适当的语言资源是开发机器翻译系统时在处理资源匮乏语言方面面临的主要挑战。本文描述了利用词汇资源提高统计机器翻译质量的有效方法。我们对词汇资源使用的研究主要集中在两种方式上,例如:用更多词汇扩充平行语料以及提供各种词形。我们已经用各种词汇资源(如词汇词、功能词、kridanta pairs和动词短语)扩充了训练语料。我们描述了马拉地语到印地语和印地语到马拉地语机器翻译系统的案例研究、评估和详细错误分析。从评估中我们观察到,随着各种词汇资源使用量的增加,机器翻译质量呈现渐进式增长。此外,在可用平行语料有限的情况下,各种词汇资源的使用有助于提高机器翻译的覆盖率和质量。
引用
@article{arxiv.1710.02398,
title = {Bilingual Words and Phrase Mappings for Marathi and Hindi SMT},
author = {Sreelekha S and Pushpak Bhattacharyya},
journal= {arXiv preprint arXiv:1710.02398},
year = {2017}
}
备注
5 pages with 5 tables and 2 figures submitted to LREC 2018. arXiv admin note: substantial text overlap with arXiv:1703.01485, arXiv:1710.02100