中文

SaudiBERT:一个在沙特方言语料库上预训练的大语言模型

计算与语言 2024-05-13 v1 人工智能

摘要

本文介绍了SaudiBERT,一个仅在沙特方言文本上预训练的单方言阿拉伯语语言模型。为证明该模型的有效性,我们将SaudiBERT与六个不同的多方言阿拉伯语语言模型在11个评估数据集上进行了比较,这些数据集分为两组:情感分析和文本分类。SaudiBERT在这些组中分别取得了86.15%和87.86%的平均F1分数,显著优于所有其他对比模型。此外,我们还提供了两个新的沙特方言语料库:包含超过1.41亿条沙特方言推文的沙特推文大型语料库(STMC),以及包含从五个沙特在线论坛收集的15.2 GB文本的沙特论坛语料库(SFC)。这两个语料库均用于预训练所提出的模型,并且是文献中报道过的最大沙特方言语料库。结果证实了SaudiBERT在理解和分析以沙特方言表达的阿拉伯语文本方面的有效性,在大多数任务中取得了最先进的结果,并超越了研究中包含的其他语言模型。SaudiBERT模型已在\url{https://huggingface.co/faisalq/SaudiBERT}上公开提供。

关键词

引用

@article{arxiv.2405.06239,
  title  = {SaudiBERT: A Large Language Model Pretrained on Saudi Dialect Corpora},
  author = {Faisal Qarah},
  journal= {arXiv preprint arXiv:2405.06239},
  year   = {2024}
}