CantonMT: 使用合成回译数据微调模型的粤语至英语 NMT 平台
计算与语言
2024-06-11 v3 人工智能
摘要
低资源语言的神经机器翻译 (NMT) 对 NLP 研究人员而言仍是一项具有挑战性的任务。在本工作中,我们将回译这一标准数据增强方法应用于一个新的语言翻译方向:粤语至英语。我们展示了使用有限真实数据以及通过回译生成的合成数据微调的模型,包括 OpusMT、NLLB 和 mBART。我们使用包括基于词法和基于嵌入的一系列不同指标进行了自动评估。此外,我们为本 CantonMT 研究项目中包含的模型创建了用户友好的界面,并将其公开以促进粤语至英语机器翻译研究。研究人员可以通过我们的开源 CantonMT 工具包 (https://github.com/kenrickkung/CantoneseTranslation) 向该平台添加更多模型。
引用
@article{arxiv.2403.11346,
title = {CantonMT: Cantonese to English NMT Platform with Fine-Tuned Models Using Synthetic Back-Translation Data},
author = {Kung Yin Hong and Lifeng Han and Riza Batista-Navarro and Goran Nenadic},
journal= {arXiv preprint arXiv:2403.11346},
year = {2024}
}
备注
Accepted by: The 25th Annual Conference of The European Association for Machine Translation, 24 - 27 June 2024, Sheffield, UK (forthcoming)