中文

PEYMA:一个波斯语命名实体标注语料库

计算与语言 2018-01-31 v1

摘要

NER 任务的目标是将文本中的专有名词分类为人物、地点和组织等类别。这是许多 NLP 任务(如问答和摘要)中的重要预处理步骤。尽管在英语中该领域已开展大量研究,且最先进的 NER 系统在 F1 值方面已达到高于 90% 的性能,但波斯语中针对该任务的研究极少。其主要重要原因之一可能是缺乏用于训练和测试 NER 系统的标准波斯语 NER 数据集。在本研究中,我们创建了一个标准的、足够大的标注波斯语 NER 数据集,并将免费分发用于研究目的。为构建这样一个标准数据集,我们研究了为英语研究构建的标准 NER 数据集,发现几乎所有这些数据集都是利用新闻文本构建的。因此我们收集了十个新闻网站的文档。随后,为使标注人员标注这些文档时有指导方针可循,在研究用于构建 CoNLL 和 MUC 标准英语数据集的指导方针后,我们结合波斯语语言规则制定了自己的指导方针。

关键词

引用

@article{arxiv.1801.09936,
  title  = {PEYMA: A Tagged Corpus for Persian Named Entities},
  author = {Mahsa Sadat Shahshahani and Mahdi Mohseni and Azadeh Shakery and Heshaam Faili},
  journal= {arXiv preprint arXiv:1801.09936},
  year   = {2018}
}

备注

2017, Signal and Data Processing Journal