Fanar:面向阿拉伯语的多模态生成式 AI 平台
计算与语言
2025-01-27 v1 人工智能
摘要
我们提出了 Fanar,一个支持语言、语音和图像生成任务的阿拉伯语中心多模态生成式 AI 平台。Fanar 的核心是 Fanar Star 和 Fanar Prime 两个高度强大的阿拉伯语大型语言模型(LLM),在众多成熟基准测试中与同类规模模型均表现卓越。Fanar Star 是一个拥有约 1 万亿(70亿)参数的模型,基于近 1 万亿干净且去重的阿拉伯语、英语和代码 token 从头训练而成。Fanar Prime 是一个拥有 90亿参数的模型,在相同的 1 万亿 token 数据集上以 Gemma-2 9B 基础模型进行持续训练。两个模型同时部署,旨在通过自定义构建的调度器透明地路由不同的类型提示。Fanar 平台提供了诸多其他能力,包括针对处理宗教相关提示的定制化阿拉伯语检索增强生成(RAG)系统,以及在预训练数据截止日期之后用于总结当前或近期事件信息的及时 RAG。平台还提供了认知能力,包括来自哈马本 Khalifa 大学卡塔公司计算研究所(QCRI)内部开发的双语语音识别(支持多种阿拉伯语方言)、面向地区特征优化的语音和图像生成,以及可用于验证事实性生成内容真实性的归因服务。Fanar 的设计、开发和实施完全由哈马本 Khalifa 大学卡塔公司计算研究所(QCRI) undertaken, 并获得卡塔通信与信息技术部的支持,以促进主权 AI 技术的发展。
引用
@article{arxiv.2501.13944,
title = {Fanar: An Arabic-Centric Multimodal Generative AI Platform},
author = {Fanar Team and Ummar Abbas and Mohammad Shahmeer Ahmad and Firoj Alam and Enes Altinisik and Ehsannedin Asgari and Yazan Boshmaf and Sabri Boughorbel and Sanjay Chawla and Shammur Chowdhury and Fahim Dalvi and Kareem Darwish and Nadir Durrani and Mohamed Elfeky and Ahmed Elmagarmid and Mohamed Eltabakh and Masoomali Fatehkia and Anastasios Fragkopoulos and Maram Hasanain and Majd Hawasly and Mus'ab Husaini and Soon-Gyo Jung and Ji Kim Lucas and Walid Magdy and Safa Messaoud and Abubakr Mohamed and Tasnim Mohiuddin and Basel Mousi and Hamdy Mubarak and Ahmad Musleh and Zan Naeem and Mourad Ouzzani and Dorde Popovic and Amin Sadeghi and Husrev Taha Sencar and Mohammed Shinoy and Omar Sinan and Yifan Zhang and Ahmed Ali and Yassine El Kheir and Xiaosong Ma and Chaoyi Ruan},
journal= {arXiv preprint arXiv:2501.13944},
year = {2025}
}