Ibom NLP:迈向 Nigeria 少数语言自然语言处理的一步
计算与语言
2025-11-11 v1 人工智能
摘要
尼日利亚是非洲人口最多的国家,人口超过 2.1 亿。尼日利亚有超过 500 种语言被使用,是世界上语言最为多样化的国家之一。尽管如此,自然语言处理(NLP)研究主要聚焦于以下四种语言:Hausa、Igbo、Nigerian-Pidgin 和 Yoruba(即尼日利亚语言中 <1% 的语言)。这部分原因是缺乏用于训练和应用 NLP 算法的文本数据。在本工作中,我们引入 ibom——尼日利亚阿克瓦伊巴姆州地区四种海岸语言:Anaang、Efik、Ibibio 和 Oro 的机器翻译和主题分类数据集。这些语言在 Google Translate 或主要基准数据集(如 Flores-200 或 SIB-200)中均未被表示。我们专注于将 Flores-200 基准扩展到这些语言,并进一步根据 SIB-200 分类数据集对翻译文本进行主题标签对齐。我们的评估显示,当前 LLM 在这些语言的机器翻译中在零样和少样设置下表现不佳。然而,我们发现少样样本能够逐步提高主题分类效果。
关键词
引用
@article{arxiv.2511.06531,
title = {Ibom NLP: A Step Toward Inclusive Natural Language Processing for Nigeria's Minority Languages},
author = {Oluwadara Kalejaiye and Luel Hagos Beyene and David Ifeoluwa Adelani and Mmekut-Mfon Gabriel Edet and Aniefon Daniel Akpan and Eno-Abasi Urua and Anietie Andy},
journal= {arXiv preprint arXiv:2511.06531},
year = {2025}
}
备注
Accepted at IJCNLP-AACL