探究低资源语言的神经机器翻译:以巴伐利亚语为案例研究
计算与语言
2024-04-15 v1
摘要
近年来,机器翻译取得了令人瞩目的进展,在许多语言上接近人类水平的性能,但研究主要集中在具有广泛在线存在和资源的高资源语言上。在日益增长的大型语言模型的帮助下,越来越多的低资源语言通过其他语言的存在取得了更好的结果。然而,研究表明,并非所有低资源语言都能从多语言系统中受益,特别是那些缺乏足够训练和评估数据的语言。在本文中,我们重新审视了最先进的神经机器翻译技术,以开发德语和巴伐利亚语之间的自动翻译系统。我们研究了低资源语言的条件,如数据稀缺和参数敏感性,并重点介绍了克服低资源困难的精细解决方案以及利用语言相似性等创造性解决方案。我们的实验包括应用反向翻译和迁移学习来自动生成更多训练数据并实现更高的翻译性能。我们展示了数据中的噪声,并提出了我们广泛进行文本预处理的方法。评估使用了结合的指标:BLEU、chrF 和 TER。使用 Bonferroni 校正的统计显著性结果显示了令人惊讶的高基线系统,并且反向翻译带来了显著的改进。此外,我们还对翻译错误和系统局限性进行了定性分析。
引用
@article{arxiv.2404.08259,
title = {Investigating Neural Machine Translation for Low-Resource Languages: Using Bavarian as a Case Study},
author = {Wan-Hua Her and Udo Kruschwitz},
journal= {arXiv preprint arXiv:2404.08259},
year = {2024}
}
备注
Preprint accepted at the 3rd Annual Meeting of the Special Interest Group on Under-resourced Languages (SIGUL 2024)