中文

Yankari:一个豪萨语单语数据集

计算与语言 2025-08-08 v2

摘要

本文提出 Yankari,一个规模庞大的豪萨语单语数据集,旨�解决该重要西非语言在自然语言处理 (NLP) 资源方面的严重不足。尽管豪萨语拥有超过 3000 万使用者,但在 NLP 研究和应用中严重被低估。我们详细阐述了创建该数据集的方法,包括严谨的来源筛选、自动质量控制和严格的数据清洗过程。Yankari 数据集包含来自 13 个不同来源的 51,407 份文档,总计超过 3000 万词元。我们的做法侧重于伦理数据收集实践,避免使用问题性来源,并解决现有数据集中普遍存在的问题。我们提供了该数据集的全面自动评估,表明其质量优于现有资源。Yankari 数据集代表了豪萨语语言资源的重大进步,为开发更准确的 NLP 模型、支持比较语言学研究以及促进豪萨语的数字可及性提供了基础。

关键词

引用

@article{arxiv.2412.03334,
  title  = {Yankari: A Monolingual Yoruba Dataset},
  author = {Maro Akpobi},
  journal= {arXiv preprint arXiv:2412.03334},
  year   = {2025}
}

备注

6 pages