中文

KazNERD:哈萨克语命名实体识别数据集

计算与语言 2022-04-08 v2 信息检索

摘要

我们介绍了用于哈萨克语命名实体识别的数据集的开发。由于明确需要公开可用的哈萨克语标注语料库,以及包含直观但严谨的规则与示例的标注指南,我们构建了该数据集。该数据集标注基于 IOB2 方案,由两位哈萨克语母语者在第一作者的监督下对电视新闻文本进行标注。最终的数据集包含 112,702 个句子和针对 25 个实体类别的 136,333 个标注。我们还构建了用于自动化哈萨克语命名实体识别的最先进机器学习模型,其中表现最佳的模型在测试集上取得了 97.22% 的精确匹配 F1 分数。标注后的数据集、指南以及用于训练模型的代码均根据 CC BY 4.0 许可证从 https://github.com/IS2AI/KazNERD 免费下载。

关键词

引用

@article{arxiv.2111.13419,
  title  = {KazNERD: Kazakh Named Entity Recognition Dataset},
  author = {Rustem Yeshpanov and Yerbolat Khassanov and Huseyin Atakan Varol},
  journal= {arXiv preprint arXiv:2111.13419},
  year   = {2022}
}

备注

10 pages, 1 figure, 8 tables, accepted to LREC 2022