YoNER:一个新的约鲁巴语多域命名实体识别数据集
计算与语言
2026-04-08 v1
摘要
命名实体识别(NER)是 NLP 的基础任务,但约鲁巴语的研究受限于有限且特定于领域的资源。现有资源,如 MasakhaNER(手动标注的新闻领域语料)和 WikiAnn(从 Wikipedia 自动创建的语料),虽然有价值,但在领域覆盖方面受限。为填补这一差距,我们提出 YoNER,一个新的约鲁巴语多域 NER 数据集,扩展了实体覆盖范围,超越新闻和 Wikipedia。该数据集包含约 5,000 句子和 100,000 个 token,来自包括《圣经》、博客、电影、广播和 Wikipedia 在内的五个领域,按照 CoNLL 风格的指南标注了三类实体:人物(PER)、组织(ORG)和地点(LOC)。注释由三位母语约鲁巴语说话者手动完成,达到 0.70 以上的注释者一致性,确保高质量和一致性。我们使用跨域实验对几种 transformer 编码器模型进行基准测试,同时评估了使用 YoNER 和跨语言设置与英语数据集进行 few-shot 领域内数据。我们的结果表明,面向非洲的模型在约鲁巴语方面优于通用多语言模型,但跨域性能显著下降,特别是针对博客和电影领域。此外,我们观察到,密切相关的正式领域(如新闻和 Wikipedia)在迁移方面效果更好。此外,我们引入了一个新的约鲁巴语特定语言模型(OyoBERT),在领域内评估中优于多语言模型。我们公开发布了 YoNER 数据集和预训练的 OyoBERT 模型,以支持未来在约鲁巴语自然语言处理方面的研究。
引用
@article{arxiv.2604.05624,
title = {YoNER: A New Yor\`ub\'a Multi-domain Named Entity Recognition Dataset},
author = {Peace Busola Falola and Jesujoba O. Alabi and Solomon O. Akinola and Folashade T. Ogunajo and Emmanuel Oluwadunsin Alabi and David Ifeoluwa Adelani},
journal= {arXiv preprint arXiv:2604.05624},
year = {2026}
}
备注
LREC 2026