利用相关低资源语言间的词汇相似性进行基于枢轴语言的统计机器翻译(SMT)
计算与语言
2017-10-06 v2
摘要
我们研究了在低资源、基于短语的统计机器翻译(SMT)设置下相关语言之间基于枢轴的翻译。我们表明,使用相关枢轴语言的子词级基于枢轴的SMT模型明显优于词和语素级的枢轴模型。它与最佳直接翻译模型也具有高度竞争力,这是令人鼓舞的,因为未使用直接的源-目标训练语料库。我们还表明,组合多个相关语言枢轴模型可以媲美直接翻译模型。因此,使用子词作为翻译单元并结合多个相关枢轴语言可以弥补缺乏直接平行语料库的不足。
引用
@article{arxiv.1702.07203,
title = {Utilizing Lexical Similarity between Related, Low-resource Languages for Pivot-based SMT},
author = {Anoop Kunchukuttan and Maulik Shah and Pradyot Prakash and Pushpak Bhattacharyya},
journal= {arXiv preprint arXiv:1702.07203},
year = {2017}
}
备注
Accepted at IJCNLP 2017, 7 pages, 7 tables