EgyBERT:基于埃及方言语料库预训练的大型语言模型
计算与语言
2024-08-08 v1
摘要
本研究提出了EgyBERT,一款基于 10.4 GB 埃及方言文本预训练的阿拉伯语语言模型。我们通过在 10 个评估数据集上与五个多方言阿拉伯语语言模型进行比较,评估了EgyBERT的性能。EgyBERT在平均 F1 分数上达到 84.25%,准确率为 87.33%,显著优于所有其他比较模型,其中 MARBERTv2 为第二佳模型,F1 分数为 83.68%,准确率为 87.19%。此外,我们引入了两个新的埃及方言语料库:埃及推文语料库(ETC),包含超过 3433 万条推文(2489 万句话),文本量为 2.5 GB;埃及论坛语料库(EFC),包含超过 4442 万句话(7.9 GB 文本),来自各类埃及在线论坛。两个语料库均用于预训练新模型,是目前文献中规模最大的埃及方言语料库。进一步的是,本文是首个对多种语言模型在埃及方言数据集上进行评估的研究,揭示了性能差异,凸显了针对特定方言构建模型的必要性。结果表明,EgyBERT在处理和分析以埃及方言表达的阿拉伯文本方面具有有效性,优于其他语言模型。EgyBERT 模型已公开于 \url{https://huggingface.co/faisalq/EgyBERT}。
引用
@article{arxiv.2408.03524,
title = {EgyBERT: A Large Language Model Pretrained on Egyptian Dialect Corpora},
author = {Faisal Qarah},
journal= {arXiv preprint arXiv:2408.03524},
year = {2024}
}