中库尔德语机器翻译:首个大规模平行语料库及实验
人工智能
2021-06-18 v1
摘要
尽管库尔德语的计算处理相对有所增加,但该语言的机器翻译似乎缺乏大量科学工作。这部分是由于缺乏专门为此任务整理的资源。在本文中,我们提出了首个中库尔德语-英语大规模平行语料库 Awta,包含 229,222 对人工对齐的翻译。我们的语料库从不同文本体裁和领域收集,以尝试构建更鲁棒且贴近实际应用的机器翻译系统。我们公开了该语料库的一部分以促进该领域的研究。此外,我们构建了若干神经机器翻译模型以对库尔德语机器翻译任务进行基准测试。我们还对结果进行了广泛的实验分析,以识别中库尔德语机器翻译面临的主要挑战。这些挑战包括本文分类的语言相关与语言无关两类,其中第一类考虑了中库尔德语在形态、句法和语义等不同层面的语言特性。我们性能最佳的系统在 KuEN 和 EnKu 方向分别取得了 22.72 和 16.81 的 BLEU 分数。
引用
@article{arxiv.2106.09325,
title = {Central Kurdish machine translation: First large scale parallel corpus and experiments},
author = {Zhila Amini and Mohammad Mohammadamini and Hawre Hosseini and Mehran Mansouri and Daban Jaff},
journal= {arXiv preprint arXiv:2106.09325},
year = {2021}
}