ArabianGPT:原生阿拉伯语基于 GPT 的大语言模型
计算与语言
2024-02-27 v2 人工智能
机器学习
摘要
英语和基于拉丁语的大语言模型(LLMs)的主导地位导致了原生阿拉伯语 LLMs 的显著缺失。现有阿拉伯语模型中普遍包含英语词元(tokens),这削弱了它们处理原生阿拉伯语复杂形态和句法的有效性,从而加剧了这一差异。因此,开发主要关注阿拉伯语语言元素的 LLMs 具有理论和实践上的必要性。为填补这一空白,本文提出了 ArabianGPT,这是 ArabianLLM 套件中一系列明确专为阿拉伯语设计的基于 Transformer 的模型。这些模型(包括 ArabianGPT-0.1B 和 ArabianGPT-0.3B)在规模和复杂性上各不相同,以适应阿拉伯语细微的语言特征。作为这些模型组成部分的 AraNizer 分词器,解决了阿拉伯文字独特的形态方面,确保了更准确的文本处理。在情感分析和摘要等任务上对模型进行微调的实证结果显示了显著改进。对于情感分析,微调后的 ArabianGPT-0.1B 模型达到了 95% 的显著准确率,比基础模型的 56% 大幅提高。同样,在摘要任务中,微调后的模型显示出更高的 F1 分数,表明生成简洁摘要的精确率和召回率有所提高。对各种基准测试中微调后的 ArabianGPT 模型与其基础版本的比较分析揭示了性能上的细微差异,微调对问答和摘要等特定任务产生了积极影响。这些发现强调了微调在使 ArabianGPT 模型更紧密地适应特定 NLP 任务方面的有效性,突显了定制 Transformer 架构在推动阿拉伯语 NLP 方面的潜力。
引用
@article{arxiv.2402.15313,
title = {ArabianGPT: Native Arabic GPT-based Large Language Model},
author = {Anis Koubaa and Adel Ammar and Lahouari Ghouti and Omar Najar and Serry Sibaee},
journal= {arXiv preprint arXiv:2402.15313},
year = {2024}
}