Konooz:面向命名实体识别的多领域多方言语料库
计算与语言
2025-06-17 v1 人工智能
摘要
我们介绍了 Konooz,这是一个新颖的多维语料库,覆盖 10 个领域的 16 种阿拉伯语方言,共产生 160 个独立语料库。该语料库包含约 777k 个标记,经过精心收集并使用嵌套和平面标注方案(采用 Wojood 指南)手动标注了 21 种实体类型。虽然 Konooz 适用于各种 NLP 任务,如领域适应和迁移学习,但本文主要聚焦于对现有阿拉伯语命名实体识别(NER)模型的基准测试,尤其是跨领域和跨方言模型的性能表现。我们使用 Konooz 对四种阿拉伯语 NER 模型进行基准测试,发现与分布内数据相比,性能下降高达 38%。此外,我们对领域和方言的差异以及资源稀缺的影响进行了深入分析。我们还使用最大均值差异(MMD)指标衡量了领域和方言之间的重叠,并说明了为什么某些 NER 模型在特定方言和领域上表现更好。Konooz 是开源的,可公开获取。
引用
@article{arxiv.2506.12615,
title = {Konooz: Multi-domain Multi-dialect Corpus for Named Entity Recognition},
author = {Nagham Hamad and Mohammed Khalilia and Mustafa Jarrar},
journal= {arXiv preprint arXiv:2506.12615},
year = {2025}
}