中文

利用双语翻译数据对大语言模型进行大规模多语言适配

计算与语言 2025-12-05 v2

摘要

本文研究了大规模多语言持续预训练实践中的一个关键设计决策——并行数据的引入。具体而言,我们研究了双语翻译数据对 Llama3 系列模型向 500 种语言进行大规模多语言语言适配的影响。为此,我们构建了 MaLA 双语翻译语料库,包含来自 2500 多个语言对的数据。随后,我们开发了由四个大规模多语言模型组成的 EMMA-500 Llama 3 套件——这些模型基于 Llama 3 系列基础模型,在多达 671B token 的多样化数据混合上进行了持续预训练——并探讨了有无双语翻译数据的持续预训练效果。在 7 项任务和 12 个基准测试上的综合评估表明,双语数据倾向于增强语言迁移和性能,特别是对于低资源语言。我们开源了 MaLA 语料库、EMMA-500 Llama 3 套件产物、代码和模型生成结果。

关键词

引用

@article{arxiv.2506.00469,
  title  = {Massively Multilingual Adaptation of Large Language Models Using Bilingual Translation Data},
  author = {Shaoxiong Ji and Zihao Li and Jaakko Paavola and Hengyu Luo and Jörg Tiedemann},
  journal= {arXiv preprint arXiv:2506.00469},
  year   = {2025}
}

备注

EMMA-500 Gen 2; refer to Gen 1 in arXiv:2409.17892