低资源语言的反向翻译数据增强:以英语与卢干达语为例
计算与语言
2025-05-06 v1
摘要
在本文中,我们探索了反向翻译(BT)作为一种半监督技术的应用,以增强英语-卢干达语对的神经机器翻译(NMT)模型,专门应对低资源语言所面临的挑战。我们研究的目的是展示 BT 如何通过从单语语料库生成合成数据来缓解双语数据的稀缺性。我们的方法包括使用公开可用和网络爬取的数据开发定制的 NMT 模型,并应用迭代和增量反向翻译技术。我们策略性地选择数据集,在多个小数据集上进行增量反向翻译,这是我们方法的一个新颖元素。我们的研究结果显示出显著改进,英语-卢干达语对的翻译性能在所有翻译方向上均超过先前基准 10 个 BLEU 分数单位以上。此外,我们的评估结合了 SacreBLEU、ChrF2 和 TER 等综合评估指标,提供了对翻译质量的细致理解。我们的研究得出的结论证实了,当利用策略性策划的数据集时,BT 是有效的,建立了新的性能基准,并展示了 BT 在增强低资源语言 NMT 模型方面的潜力。
关键词
引用
@article{arxiv.2505.02463,
title = {Data Augmentation With Back translation for Low Resource languages: A case of English and Luganda},
author = {Richard Kimera and Dongnyeong Heo and Daniela N. Rim and Heeyoul Choi},
journal= {arXiv preprint arXiv:2505.02463},
year = {2025}
}
备注
NLPIR '24: Proceedings of the 2024 8th International Conference on Natural Language Processing and Information Retrieval