利用语言关联性改进机器翻译:以印度次大陆语言为例
计算与语言
2020-03-20 v1
摘要
在这项工作中,我们呈现了一项涉及印度次大陆语言的统计机器翻译的广泛研究。这些语言通过发生学与接触关系相关联。我们描述了因这些关系而产生的印度语言的相似性。我们探索了当可用平行语料有限时,如何借助这些语言间的词汇与正字法相似性来提升印度语言之间的翻译质量。我们还探索了如何利用印度语言间的结构对应来重用英语到印度语言的翻译语言资源。我们的观察涵盖来自9种印度语言与英语的90个语言对。据我们所知,这是首个专门致力于利用语言关联性改进相关语言间翻译的大规模研究。
引用
@article{arxiv.2003.08925,
title = {Utilizing Language Relatedness to improve Machine Translation: A Case Study on Languages of the Indian Subcontinent},
author = {Anoop Kunchukuttan and Pushpak Bhattacharyya},
journal= {arXiv preprint arXiv:2003.08925},
year = {2020}
}
备注
This work was done in 2017-2018 as part of the first author's thesis