中文

面向低资源机器翻译的单语与平行数据的预训练策略

计算与语言 2025-10-30 v1

摘要

本研究文章考察了 various pretraining strategies for developing machine translation models tailored to low-resource languages. 虽然本工作考虑了包括阿非利卡语、斯瓡希利语和祖鲁语在内的多种低资源语言,但翻译模型特别针对一种资源匮乏的非洲语言—— Lingala 进行开发,基于 Reid 和 Artetxe (2021) 于高资源语言上设计的预训练方法。通过一系列全面实验,我们探索了不同的预训练方法,包括整合多语言和在预训练阶段同时使用单语与平行数据。我们的发现表明,针对多语言进行预训练以及同时利用单语与平行数据可显著提升翻译质量。本研究为低资源机器翻译提供了有效的预训练策略,帮助缩小高资源与低资源语言之间的性能差距。该研究的成果为开发面向被边缘化社区和少数族裔人群的更具包容性和准确的 NLP 模型贡献了重要建议。本研究使用的代码和数据集已公开获取,以便进一步研究和确保可重复性,尽管部分数据因可获得性变化而不再可用。

关键词

引用

@article{arxiv.2510.25116,
  title  = {Pretraining Strategies using Monolingual and Parallel Data for Low-Resource Machine Translation},
  author = {Idriss Nguepi Nguefack and Mara Finkelstein and Toadoum Sari Sakayo},
  journal= {arXiv preprint arXiv:2510.25116},
  year   = {2025}
}

备注

8 pages, 1. figure