中文

低资源语言的反向翻译数据增强:以英语与卢干达语为例

计算与语言 2025-05-06 v1

摘要

在本文中,我们探索了反向翻译(BT)作为一种半监督技术的应用,以增强英语-卢干达语对的神经机器翻译(NMT)模型,专门应对低资源语言所面临的挑战。我们研究的目的是展示 BT 如何通过从单语语料库生成合成数据来缓解双语数据的稀缺性。我们的方法包括使用公开可用和网络爬取的数据开发定制的 NMT 模型,并应用迭代和增量反向翻译技术。我们策略性地选择数据集,在多个小数据集上进行增量反向翻译,这是我们方法的一个新颖元素。我们的研究结果显示出显著改进,英语-卢干达语对的翻译性能在所有翻译方向上均超过先前基准 10 个 BLEU 分数单位以上。此外,我们的评估结合了 SacreBLEU、ChrF2 和 TER 等综合评估指标,提供了对翻译质量的细致理解。我们的研究得出的结论证实了,当利用策略性策划的数据集时,BT 是有效的,建立了新的性能基准,并展示了 BT 在增强低资源语言 NMT 模型方面的潜力。

关键词

引用

@article{arxiv.2505.02463,
  title  = {Data Augmentation With Back translation for Low Resource languages: A case of English and Luganda},
  author = {Richard Kimera and Dongnyeong Heo and Daniela N. Rim and Heeyoul Choi},
  journal= {arXiv preprint arXiv:2505.02463},
  year   = {2025}
}

备注

NLPIR '24: Proceedings of the 2024 8th International Conference on Natural Language Processing and Information Retrieval