使用大规模地名词典的用于命名实体识别与文本分类的自动标注土耳其语语料库
计算与语言
2017-02-10 v2
摘要
Turkish Wikipedia Named-Entity Recognition and Text Categorization (TWNERTC) 数据集是一个从维基百科获得的自动分类与标注句子的集合。我们通过使用图爬虫算法从语义知识库Freebase中提取相关实体与领域信息,构建了大规模地名词典。所构建的地名词典包含约300K个实体,具有数千种细粒度实体类型,涵盖77个不同领域。由于自动化过程容易产生歧义,我们还引入了两种新的内容特定噪声降低方法。此外,我们将细粒度实体类型映射到等价的四种粗粒度类型:person、loc、org、misc。最终,我们构建了六个不同的数据集版本,并通过比较人类标注者的真值来评估标注质量。我们公开这些数据集以支持对土耳其语命名实体识别 (NER) 和文本分类 (TC) 的研究。
引用
@article{arxiv.1702.02363,
title = {Automatically Annotated Turkish Corpus for Named Entity Recognition and Text Categorization using Large-Scale Gazetteers},
author = {H. Bahadir Sahin and Caglar Tirkaz and Eray Yildiz and Mustafa Tolga Eren and Ozan Sonmez},
journal= {arXiv preprint arXiv:1702.02363},
year = {2017}
}
备注
10 page, 1 figure, white paper, update: added correct download link for dataset