面向吉尔吉斯语的人工标注 NER 数据集
计算与语言
2025-09-24 v1
摘要
我们引入了 KyrgyzNER,这是第一个针对吉尔吉斯语的人工标注命名实体识别数据集。该数据集包含来自 24.KG 新闻门户网站的 1,499 篇新闻文章,涵盖 10,900 个句子和 27 个命名实体类别中的 39,075 个实体提及。我们展示了我们的标注方案,讨论了标注过程中遇到的挑战,并给出了描述性统计数据。我们还评估了几种命名实体识别模型,包括基于条件随机场的传统序列标注方法以及在我们的数据集上微调的最先进的多语言基于 Transformer 的模型。虽然所有模型在稀有实体类别上都表现出困难,但在多种语言的大型语料库上预训练的多语言 RoBERTa 变体等模型在精确率和召回率之间实现了有希望的平衡。这些发现强调了使用多语言预训练模型处理有限资源语言所面临的挑战和机遇。尽管多语言 RoBERTa 模型表现最佳,但其他多语言模型也产生了可比的结果。这表明,探索更细粒度标注方案的未来工作可能为吉尔吉斯语处理流程评估提供更深入的见解。
引用
@article{arxiv.2509.19109,
title = {Human-Annotated NER Dataset for the Kyrgyz Language},
author = {Timur Turatali and Anton Alekseev and Gulira Jumalieva and Gulnara Kabaeva and Sergey Nikolenko},
journal= {arXiv preprint arXiv:2509.19109},
year = {2025}
}
备注
Accepted to TurkLang-2025 conference, DOI and copyright will be added upon confirmation of acceptance to publication in IEEE Xplore