中文

NusaMT-7B:面向低资源印尼语言的大型语言模型机器翻译

计算与语言 2024-10-11 v1

摘要

大型语言模型(LLM)在高资源语言的翻译任务中展现出卓越的潜力。然而,由于平行语料和单语语料的稀缺以及噪声的存在,这些模型在低资源语言上的表现受到限制。 Consequently,这些 LLM 在对齐方面存在困难,在这些场景下滞后于最先进(SoTA)神经机器翻译(NMT)模型。本文介绍了 NusaMT-7B,这是一个面向低资源印尼语言的大型语言模型机器翻译模型,首次针对巴 Balinese 和 Minangkabau 两种语言进行实验。我们基于预训练的 LLaMA2-7B,集成了在单语数据上的继续预训练、监督微调(SFT)、自学习以及基于 LLM 的数据清洗器,以减少平行句中的噪声。在 FLORES-200 多语言翻译基准中,NusaMT-7B 在翻译至巴 Balinese 和 Minangkabau 时,以最高可达 +6.69 个 spBLEU 的提升超过最先进模型;但在翻译至高资源语言时,表现略逊于最先进模型,最高损失可达 -3.38 个 spBLEU。我们的实验表明,经过微调的大型语言模型可以提升低资源语言的翻译质量,助力语言保存与跨文化交流。

关键词

引用

@article{arxiv.2410.07830,
  title  = {NusaMT-7B: Machine Translation for Low-Resource Indonesian Languages with Large Language Models},
  author = {William Tan and Kevin Zhu},
  journal= {arXiv preprint arXiv:2410.07830},
  year   = {2024}
}

备注

Accepted to SoLaR @ NeurIPS 2024