中文

面向阿拉伯方言的开放获取NLP数据集:数据收集、标注与模型构建

计算与语言 2021-02-23 v1 机器学习

摘要

自然语言处理(NLP)当今是极具活跃度的研究与创新领域。许多应用需要大规模监督学习数据集,并需为训练目的进行恰当标注。这包括面向阿拉伯语及其民族方言的应用。然而,阿拉伯语及其方言的此类开放获取标注数据集在数据科学生态中十分匮乏,这一缺失可能成为该领域创新与研究的障碍。本工作中,我们呈现一个包含多种阿拉伯方言社交数据内容的开放数据集。该数据收集自Twitter社交网络,由五种(5)民族方言的逾5万条推文组成。此外,该数据针对若干应用进行了标注,即方言检测、话题检测与情感分析。我们将此数据作为开放获取数据发布,以鼓励创新并推动阿拉伯方言与社交媒体NLP领域的其他工作。利用该数据集构建了一系列模型,本文展示了这些模型及其性能。

关键词

引用

@article{arxiv.2102.11000,
  title  = {An open access NLP dataset for Arabic dialects : Data collection, labeling, and model construction},
  author = {ElMehdi Boujou and Hamza Chataoui and Abdellah El Mekki and Saad Benjelloun and Ikram Chairi and Ismail Berrada},
  journal= {arXiv preprint arXiv:2102.11000},
  year   = {2021}
}