中文

Konooz:面向命名实体识别的多领域多方言语料库

计算与语言 2025-06-17 v1 人工智能

摘要

我们介绍了 Konooz,这是一个新颖的多维语料库,覆盖 10 个领域的 16 种阿拉伯语方言,共产生 160 个独立语料库。该语料库包含约 777k 个标记,经过精心收集并使用嵌套和平面标注方案(采用 Wojood 指南)手动标注了 21 种实体类型。虽然 Konooz 适用于各种 NLP 任务,如领域适应和迁移学习,但本文主要聚焦于对现有阿拉伯语命名实体识别(NER)模型的基准测试,尤其是跨领域和跨方言模型的性能表现。我们使用 Konooz 对四种阿拉伯语 NER 模型进行基准测试,发现与分布内数据相比,性能下降高达 38%。此外,我们对领域和方言的差异以及资源稀缺的影响进行了深入分析。我们还使用最大均值差异(MMD)指标衡量了领域和方言之间的重叠,并说明了为什么某些 NER 模型在特定方言和领域上表现更好。Konooz 是开源的,可公开获取。

关键词

引用

@article{arxiv.2506.12615,
  title  = {Konooz: Multi-domain Multi-dialect Corpus for Named Entity Recognition},
  author = {Nagham Hamad and Mohammed Khalilia and Mustafa Jarrar},
  journal= {arXiv preprint arXiv:2506.12615},
  year   = {2025}
}