面向土著语言翻译的平行语料库:西班牙语-马萨特克语与西班牙语-米斯特克语
计算与语言
2023-05-30 v1
摘要
在本文中,我们提出了一个用于机器翻译(MT)任务的西班牙语-马萨特克语和西班牙语-米斯特克语平行语料库,其中马萨特克语和米斯特克语是两种墨西哥土著语言。我们使用三种不同方法评估所收集语料库的可用性:Transformer、迁移学习以及微调预训练多语言MT模型。微调Facebook M2M100-48模型的表现优于其他方法,马萨特克语-西班牙语和西班牙语-马萨特克语翻译的BLEU分数分别为12.09和22.25,米斯特克语-西班牙语和西班牙语-米斯特克语翻译的BLEU分数分别为16.75和22.15。结果表明,数据集规模(马萨特克语9,799句,米斯特克语13,235句)影响翻译性能,且土著语言作为目标语言时表现更好。这些发现强调了为土著语言构建平行语料库以及为低资源翻译任务微调模型的重要性。未来研究将探索零样本和少样本学习方法来进一步提升低资源环境下的翻译性能。数据集与脚本见 \url{https://github.com/atnafuatx/Machine-Translation-Resources}
引用
@article{arxiv.2305.17404,
title = {Parallel Corpus for Indigenous Language Translation: Spanish-Mazatec and Spanish-Mixtec},
author = {Atnafu Lambebo Tonja and Christian Maldonado-Sifuentes and David Alejandro Mendoza Castillo and Olga Kolesnikova and Noé Castro-Sánchez and Grigori Sidorov and Alexander Gelbukh},
journal= {arXiv preprint arXiv:2305.17404},
year = {2023}
}
备注
Accepted to Third Workshop on NLP for Indigenous Languages of the Americas