中文

AfriqueLLM:数据混合与模型架构如何影响非洲语言的持续预训练

计算与语言 2026-05-06 v2

摘要

大语言模型正日益多语言化,然而开源模型的表现仍逊于专有系统,其中非洲语言的差距最为显著。持续预训练提供了一条实用的语言适应途径,但在数学推理等要求较高的能力上的提升通常仍然有限。这种局限性部分源于许多低资源语言语料库所特有的领域覆盖不均和任务相关知识缺失。我们提出了\texttt{AfricaLLM},这是一套通过在260亿token上进行持续预训练而适应20种非洲语言的开源大语言模型套件。我们跨越五种涵盖不同规模和架构的基础模型(包括Llama 3.1、Gemma 3和Qwen 3)进行了全面的实证研究,并系统分析了持续预训练数据组成如何影响下游性能。具体而言,我们改变了包含数学、代码和合成翻译数据的混合比例,并在一系列多语言基准上评估了所得模型。我们的结果确定数据组成是持续预训练收益的主要驱动因素。添加数学、代码和合成翻译数据带来了持续改进,包括在面向推理的评估中。在固定架构内,较大的模型通常能提升性能,但在跨模型家族比较时,架构选择主导了规模的影响。此外,基础模型中强大的多语言性能并不能可靠地预测持续预训练后的结果;稳健的架构与任务对齐的数据相结合提供了更可靠的方案。最后,我们最好的模型提升了长上下文性能,包括文档级翻译。模型已在[Huggingface](https://huggingface.co/collections/McGill-NLP/afriquellm)上发布。

关键词

引用

@article{arxiv.2601.06395,
  title  = {AfriqueLLM: How Data Mixing and Model Architecture Impact Continued Pre-training for African Languages},
  author = {Hao Yu and Tianyi Xu and Michael A. Hedderich and Wassim Hamidouche and Syed Waqas Zamir and David Ifeoluwa Adelani},
  journal= {arXiv preprint arXiv:2601.06395},
  year   = {2026}
}