Lugha-Llama: 适配非洲语言的大语言模型
计算与语言
2025-04-10 v1 人工智能
机器学习
摘要
大语言模型 (LLM) 在广泛的自然语言应用中取得了令人印象的成果。但它们往往难以识别低资源语言,特别是非洲语言,这些语言在大规模训练语料中代表不足。在本文中,我们考虑如何为低资源非洲语言适配 LLM。我们发现,将来自非洲语言的精选数据与高质量英语教育文本组合,可显著提高模型在这些语言上的性能。在具有挑战性的 IrokoBench 数据集上,我们的模型在规模相似的基线模型中始终取得最佳性能,尤其是在知识密集型多选题 (AfriMMLU) 上。此外,在跨语言问答基准数据集 AfriQA 上,我们的模型相较基线模型提升超过 10%。为更好地理解英语数据在训练中的作用,我们翻译了 2 亿 token 的子集为斯瓦希利语并进行分析,发现这些数据的内容主要负责了强大的性能。我们发布我们的模型和数据,以鼓励未来在非洲语言研究方面的工作。
关键词
引用
@article{arxiv.2504.06536,
title = {Lugha-Llama: Adapting Large Language Models for African Languages},
author = {Happy Buzaaba and Alexander Wettig and David Ifeoluwa Adelani and Christiane Fellbaum},
journal= {arXiv preprint arXiv:2504.06536},
year = {2025}
}