尼日利亚低资源语言 NaijaNLP: 综述
计算与语言
2025-03-10 v2 人工智能
摘要
尼日利亚拥有超过 500 种语言,哈萨、尼日利亚-乌拉巴和伊格博三种语言拥有超过 1.75 亿人口,约占语言总数的 60%。然而,这些语言因资源不足被归类为低资源。尽管已有多项研究和倡议,但从语法形式化到支持复杂任务(如语言理解和生成)的语言资源的整体理解仍不完整。本研究提出首个针对尼日利亚三大主要低资源语言(NaijaNLP)的综合综述。我们定量评估了可用语言资源,识别出关键挑战。尽管已有越来越多的文献涉及哈萨、伊格博和尼日利亚-乌拉巴等三种语言的各种 NLP 下游任务,但仅约 25.1% 的研究作品贡献了新的语言资源。这一发现突显了对现有数据进行再利用而非生成新型高质量资源的持续依赖。此外,像正确表示 diacritics 这样的语言特定挑战仍未得到充分探讨。为推动 NaijaNLP 及更广泛的 LR-NLP 研究, 我们强调需要加大资源丰富、全面标注和开放合作倡议的力度。
引用
@article{arxiv.2502.19784,
title = {NaijaNLP: A Survey of Nigerian Low-Resource Languages},
author = {Isa Inuwa-Dutse},
journal= {arXiv preprint arXiv:2502.19784},
year = {2025}
}
备注
35 pages, 2 figures, 4 tables