中文

EMMA-500:提升大型语言模型大规模多语言适应性

计算与语言 2025-12-05 v3

摘要

本文介绍了 EMMA-500,这是一个大规模多语言语言模型,通过在涵盖 546 种语言的文本上进行持续预训练而得,旨在实现更好的多语言性能,侧重于提高低资源语言的覆盖范围。为便于持续预训练,我们构建了 MaLA 语料库,这是一个涵盖多样领域的综合性多语言数据集,并经过精心筛选。基于该语料库,我们对 Llama 2 7B 模型进行了大规模持续预训练,得到 EMMA-500,其在广泛的基准测试中表现稳健,包括一套全面的多语言任务。我们的结果表明,持续预训练在扩大大型语言模型语言能力方面有效,尤其是针对欠代表产语言,显示出在跨语言迁移、任务泛化和语言适应性方面显著提升。我们发布了 MaLA 语料库、EMMA-500 模型权重、脚本及模型生成结果。

关键词

引用

@article{arxiv.2409.17892,
  title  = {EMMA-500: Enhancing Massively Multilingual Adaptation of Large Language Models},
  author = {Shaoxiong Ji and Zihao Li and Jaakko Paavola and Peiqin Lin and Pinzhen Chen and Dayyán O'Brien and Hengyu Luo and Hinrich Schütze and Jörg Tiedemann and Barry Haddow},
  journal= {arXiv preprint arXiv:2409.17892},
  year   = {2025}
}