Fanar 2.0:阿拉伯语生成式 AI 堆栈
摘要
我们介绍 Fanar 2.0,即 Qatar 阿拉伯语中心生成式 AI 平台的第二代。主权是首要设计原则:从数据管道到部署基础设施,所有组件均在 QCRI 和哈马德·本·卡利·法里亚大学完全设计和运行。Fanar 2.0 是资源受限卓越实践的典范:项目在 256 块 NVIDIA H100 GPU 上运行,尽管阿拉伯语拥有约 4 亿 native 说话者,但仅占网页数据的约 0.5%。Fanar 2.0 采用数据质量优先于数量、精准持续预训练和模型合并策略,在资源受限条件下实现显著提升。核心为 Fanar-27B,基于 Gemma-3-27B 主干在 1200 亿高质量 token 的精选语料库上进行持续预训练。尽管使用 8 倍少于 Fanar 1.0 的预训练 token,但它在各项基准测试上实现显著提升:阿拉伯语知识提升 9.1 分,语言能力提升 7.3 分,方言提升 3.5 分,英语能力提升 7.6 分。除了核心大语言模型,Fanar 2.0 引入了丰富的新功能。FanarGuard 是面向阿拉伯语安全和文化对齐的领先级 4B 双语 moderation 过滤器。语音系列 Aura 获得用于时长音频的长篇 ASR 模型。Oryx 视觉系列添加了阿拉伯语感知的图像和视频理解功能,以及文化导向的图像生成。智能体工具调用框架实现多步骤工作流程。Fanar-Sadiq 采用多智能体架构处理伊斯兰内容。Fanar-Diwan 提供古典阿拉伯语诗歌生成。FanarShaheen 交付基于 LLM 的双语翻译。全新设计的多层编排器通过意图感知路由和防御性深度安全验证协调所有组件。综上所述,Fanar 2.0 证明了在更大规模下构建的系统仍可通过主权、资源受限的 AI 开发实现竞争水平。
引用
@article{arxiv.2603.16397,
title = {Fanar 2.0: Arabic Generative AI Stack},
author = {FANAR TEAM and Ummar Abbas and Mohammad Shahmeer Ahmad and Minhaj Ahmad and Abdulaziz Al-Homaid and Anas Al-Nuaimi and Enes Altinisik and Ehsaneddin Asgari and Sanjay Chawla and Shammur Chowdhury and Fahim Dalvi and Kareem Darwish and Nadir Durrani and Mohamed Elfeky and Ahmed Elmagarmid and Mohamed Eltabakh and Asim Ersoy and Masoomali Fatehkia and Mohammed Qusay Hashim and Majd Hawasly and Mohamed Hefeeda and Mus'ab Husaini and Keivin Isufaj and Soon-Gyo Jung and Houssam Lachemat and Ji Kim Lucas and Abubakr Mohamed and Tasnim Mohiuddin and Basel Mousi and Hamdy Mubarak and Ahmad Musleh and Mourad Ouzzani and Amin Sadeghi and Husrev Taha Sencar and Mohammed Shinoy and Omar Sinan and Yifan Zhang},
journal= {arXiv preprint arXiv:2603.16397},
year = {2026}
}