通过迁移学习推进低资源印度语言的机器翻译
计算与语言
2024-09-25 v1 人工智能
摘要
本文介绍了华为翻译中心(HW-TSC)向WMT24印度语言机器翻译(MT)共享任务提交的系统。为了为低资源印度语言开发可靠的机器翻译系统,我们考虑了语言脚本的特点以及现有开源模型对印度语言的支持,采用了两种不同的知识迁移策略。对于阿萨姆语(as)和曼尼普尔语(mn),我们对现有的IndicTrans2开源模型进行了微调,以实现英语与这些语言之间的双向翻译。对于卡西语(kh)和米佐语(mz),我们使用这四个语言对的双语数据以及额外的约8万词英语-孟加拉语双语数据(这些数据共享某些语言特征)训练了一个多语言模型作为基线。随后进行微调,以实现英语与卡西语以及英语与米佐语之间的双向翻译。我们的迁移学习实验取得了令人印象深刻的结果:在各自的测试集上,en-as的BLEU值为23.5,en-mn为31.8,as-en为36.2,mn-en为47.9。类似地,多语言模型的迁移学习实验也取得了显著成果,在各自的测试集上,en-kh的BLEU值为19.7,en-mz为32.8,kh-en为16.1,mz-en为33.9。这些结果不仅凸显了迁移学习技术对低资源语言的有效性,而且有助于提升低资源印度语言的机器翻译能力。
引用
@article{arxiv.2409.15879,
title = {Machine Translation Advancements of Low-Resource Indian Languages by Transfer Learning},
author = {Bin Wei and Jiawei Zhen and Zongyao Li and Zhanglin Wu and Daimeng Wei and Jiaxin Guo and Zhiqiang Rao and Shaojun Li and Yuanchang Luo and Hengchao Shang and Jinlong Yang and Yuhao Xie and Hao Yang},
journal= {arXiv preprint arXiv:2409.15879},
year = {2024}
}
备注
6 pages, wmt24. arXiv admin note: substantial text overlap with arXiv:2409.14800