中文

GemMaroc:用最小数据提升大语言模型达语 proficiency

计算与语言 2025-05-26 v1 人工智能

摘要

开源大语言模型(LLMs)仍边缘化摩洛哥阿拉伯语(Darija),迫使实践者不得不拼接重量级阿拉伯语适配器,或牺牲LLMs所谓的推理能力。我们展示,严格的质量优先于数量的对齐策略,即可在极少计算资源下激发流畅的 Darija 表达,同时保留模型的跨语言推理能力。我们将 LIMA 1K、DEITA 6K 和 TULU 50K 三个紧凑指令套件翻译为 Darija,保留 20% 的英文原本,并添加数学、编程与科学提示。基于 5K 条混合指令训练的 LoRA 微调 Gemma 3-4B 模型,将 DarijaMMLU 分数提升至 42.7 分;加入推理密集型的 TULU 部分后,其得分提升至 47.5 分,且无英文基准退步。将相同配方扩展至 Gemma 3-27B,构建的 GemMaroc-27B 在 DarijaMMLU 上达到 61.6 分,匹配 Atlas-Chat,在 Darija 常识测试中取得 60.5 分(Atlas-Chat 仅为 48.4 分)。关键在于,GemMaroc 保留了 Gemma-27B 的强大数学与一般推理能力,在 GSM8K 与英文基准上仅有微小变化。整个模型仅需 48 个 GPU 小时即可完成训练,凸显了通往包容性、可持续语言技术的绿色 AI 路径。我们发布代码、数据与模型 checkpoint,以激发以达语为中心的教育、公共服务及日常数字交互应用。

关键词

引用

@article{arxiv.2505.17082,
  title  = {GemMaroc: Unlocking Darija Proficiency in LLMs with Minimal Data},
  author = {Abderrahman Skiredj and Ferdaous Azhari and Houdaifa Atou and Nouamane Tazi and Ismail Berrada},
  journal= {arXiv preprint arXiv:2505.17082},
  year   = {2025}
}