中文

面向阿拉伯语大语言模型的塔哈科姆指南与配方:从预训练数据到阿拉伯语 LLM

机器学习 2025-10-28 v2

摘要

大语言模型(LLM)在自然语言处理领域取得了显著进展,增强了在多个领域的语言理解和生成能力。然而,为阿拉伯语开发 LLM 面临独特挑战。本文聚焦数据 curated、tokenizer 设计和评估等关键方面,探讨了这些挑战。我们详细阐述了阿拉伯语预训练数据集的收集与过滤方法,评估了各种 tokenizer 设计对模型性能的影响,并检讨了现有阿拉伯语评估框架的局限性,提出了系统性的纠正方法。为促进透明度并促进合作开发,我们分享了我们的数据和方法,为语言建模,特别是阿拉伯语语言的发展做出了贡献。

关键词

引用

@article{arxiv.2510.13481,
  title  = {Tahakom LLM Guidelines and Recipes: From Pre-training Data to an Arabic LLM},
  author = {Areej AlOtaibi and Lina Alyahya and Raghad Alshabanah and Shahad Alfawzan and Shuruq Alarefei and Reem Alsabti and Nouf Alsubaie and Abdulaziz Alhuzaymi and Lujain Alkhelb and Majd Alsayari and Waad Alahmed and Omar Talabay and Jalal Alowibdi and Salem Alelyani and Adel Bibi},
  journal= {arXiv preprint arXiv:2510.13481},
  year   = {2025}
}