中文

首个大规模多样化豪萨语数据集集萃

计算与语言 2021-02-18 v2

摘要

豪萨语属于亚非语系,其母语使用者数量超过任何其他撒哈拉以南非洲语言。该语言大多数使用者分别居住在尼日利亚的北部和南部地区以及尼日尔共和国,估计有超过一亿人使用这种语言。因此,它成为使用最广泛的乍得语族语言之一。尽管在撒哈拉以南非洲语言中,豪萨语被视为研究充分且有文献记录的语言,但从自然语言处理(NLP)的角度来看,由于可用于 NLP 相关任务的资源有限,它被视为低资源语言。这是非洲大多数语言的共性;因此,用资源来丰富此类语言至关重要,这些资源将支持并加快执行各种下游任务以满足现代社会的需求。虽然存在有用的数据集,特别是来自新闻网站和宗教文本的数据集,但语料库还需要更多的多样性。我们提供了一套广泛的精选数据集,分别来自可靠网站和在线社交媒体网络,包含该语言的正式与非正式形式。该集萃规模更大、多样性超过现有语料库,提供了首个也是最大的豪萨语社交媒体数据帖子集合,以捕捉该语言中的特殊性。该集萃还包含一个平行数据集,可用于机器翻译等任务,并应用于检测虚假或煽动性在线内容等领域。我们描述了整理过程——从收集、预处理到如何获取数据——并提出了一些可利用该数据解决的研究问题。

关键词

引用

@article{arxiv.2102.06991,
  title  = {The first large scale collection of diverse Hausa language datasets},
  author = {Isa Inuwa-Dutse},
  journal= {arXiv preprint arXiv:2102.06991},
  year   = {2021}
}

备注

10 pages, 5 figures, 2 tables