KIND:一个意大利语多领域命名实体识别数据集
计算与语言
2022-06-15 v2
摘要
本文介绍 KIND,一个用于命名实体识别的意大利语数据集。它包含超过一百万个 token,标注涵盖三个类别:人物、地点和组织。该数据集(约 600K token)主要包含三个不同领域(新闻、文学和政治话语)的人工金标注以及一个半自动标注部分。多领域特性是本研究的主要优势,提供了一个覆盖不同文体与语言用法的资源,也是最大的带人工金标注的意大利语 NER 数据集。它是训练意大利语 NER 系统的重要资源。文本与标注可从 Github 仓库免费下载。
引用
@article{arxiv.2112.15099,
title = {KIND: an Italian Multi-Domain Dataset for Named Entity Recognition},
author = {Teresa Paccosi and Alessio Palmero Aprosio},
journal= {arXiv preprint arXiv:2112.15099},
year = {2022}
}