利用多语言新闻网站构建库尔德语平行语料库
计算与语言
2020-10-06 v1
摘要
机器翻译一直是自然语言处理发展的重要推动力。尽管借助深度学习方法在创建更高效的机器翻译系统方面取得了蓬勃发展,平行语料库对该领域的进步仍不可或缺。为创建库尔德语平行语料库,本文描述了我们从多语言网站检索潜在可对齐新闻文章、并基于词汇相似度与文字转写在不同方言及语言间进行人工对齐的方法。我们呈现了一个包含库尔德语两大主要方言 Sorani 与 Kurmanji 共 12,327 个翻译对的语料库,并提供 1,797 个 English-Kurmanji 与 650 个 English-Sorani 翻译对。该语料库依据 CC BY-NC-SA 4.0 许可公开可用。
引用
@article{arxiv.2010.01554,
title = {Leveraging Multilingual News Websites for Building a Kurdish Parallel Corpus},
author = {Sina Ahmadi and Hossein Hassani and Daban Q. Jaff},
journal= {arXiv preprint arXiv:2010.01554},
year = {2020}
}
备注
11 pages, under review in the ACM Transactions on Asian and Low-Resource Language Information Processing (TALLIP) Corpus available at https://github.com/KurdishBLARK/InterdialectCorpus