中文

Alif:通过多语言合成数据蒸馏发展阿拉伯语大语言模型

计算与语言 2025-10-13 v1 人工智能 机器学习

摘要

为低资源语言如阿拉伯语开发高性能大语言模型(LLM)存在诸多挑战,包括高质量数据稀缺、多语言不一致以及安全问题。现有多语言大语言模型通常通过翻译大量可用数据来解决这些问题,但此类翻译往往质量不高且缺乏文化细微差别,同时也为数据精选和训练带来高额成本。为此,我们提出了 Alif-1.0-8B-Instruct,这是一个多语言阿拉伯语-英语模型,通过独特方法应对上述挑战。我们在使用修改自我指令技术开发的高质量多语言合成数据集(Urdu-Instruct)上进行训练。通过为每个任务使用唯一的提示和种子值,并结合全局任务池,该数据集融合了阿拉伯语本地链式思维推理、双语翻译、文化相关性以及伦理安全对齐。这一技术显著提升了 Alif-1.0-8B-Instruct 模型对阿拉伯语特定任务的理解能力。结果表明,基于预训练的 Llama-3.1-8B 构建的 Alif-1.0-8B-Instruct 在阿拉伯语特定任务上优于 Llama-3.1-8B-Instruct,同时在训练预算不到百美元的前提下,超过了Mistral-7B-Instruct-v0.3、Qwen-2.5-7B-Instruct 和 Cohere-Aya-Expanse-8B等领先的多语言大语言模型。我们的研究表明,利用修改自我指令方法,可以在保持高性能的同时高效且符合文化规范地开发低资源语言的大语言模型。所有数据集、模型和代码均已公开 disponible at: https://github.com/traversaal-ai/alif-urdu-llm。

关键词

引用

@article{arxiv.2510.09051,
  title  = {Alif: Advancing Urdu Large Language Models via Multilingual Synthetic Data Distillation},
  author = {Muhammad Ali Shafique and Kanwal Mehreen and Muhammad Arham and Maaz Amjad and Sabur Butt and Hamza Farooq},
  journal= {arXiv preprint arXiv:2510.09051},
  year   = {2025}
}

备注

Accepted to the EMNLP 2025 Workshop on Multilingual Representation Learning (MRL)