中文

JASMINE:用于少样本学习的阿拉伯语GPT模型

计算与语言 2023-10-26 v2

摘要

关于生成式预训练(GPT)的学术研究仍严重以英语为中心,使我们对整个自回归模型类的理解存在严重缺口。例如,我们对这些模型在多样化语言与文化环境中的潜力及其社会影响知之甚少。我们针对阿拉伯语——一个拥有超过4亿人口、包含广泛语言与方言变体的语族——引入了JASMINE以缓解此问题。JASMINE是一套强大的阿拉伯语自回归Transformer语言模型,参数规模介于3亿至67亿之间,在大型且多样的数据集(约235 GB文本)上预训练。我们还精心设计并发布了一个全面的基准,用于对阿拉伯语自回归模型进行自动与人工评估,涵盖潜在的社会偏见、危害与毒性。利用我们的新基准,我们广泛评估了JASMINE,显示出其在内在性能以及广泛NLP任务少样本学习上的强大表现。我们旨在向感兴趣的研究者负责任地发布我们的模型与评估基准,以及用于实验的代码。

关键词

引用

@article{arxiv.2212.10755,
  title  = {JASMINE: Arabic GPT Models for Few-Shot Learning},
  author = {El Moatez Billah Nagoudi and Muhammad Abdul-Mageed and AbdelRahim Elmadany and Alcides Alcoba Inciarte and Md Tawkat Islam Khondaker},
  journal= {arXiv preprint arXiv:2212.10755},
  year   = {2023}
}