Razmecheno:来自数字日记档案“Prozhito”的命名实体识别
计算与语言
2022-01-26 v1
摘要
绝大多数现有的命名实体识别(NER)数据集主要基于新闻、研究论文和维基百科构建,仅有少数例外来自历史和文学文本。此外,英语是用于进一步标注的主要数据来源。本文旨在通过创建一个新颖的数据集“Razmecheno”来填补多个空白,该数据集收集自俄语项目“Prozhito”的日记文本。我们的数据集对多个研究方向都有意义:日记文本的文学研究、来自其他领域的迁移学习、低资源或跨语言的命名实体识别。Razmecheno包含1331个句子和14119个词例,采样自改革时期所写的日记。标注模式由五个常用实体标签组成:人物、特征、地点、组织和设施。标注在众包平台Yandex.Toloka上分两个阶段进行。首先,工人选择包含特定类型实体的句子。其次,他们标记出实体跨度。结果共获得1113个实体。我们使用现成的NER工具并通过微调预训练的上下文编码器对Razmecheno进行了实证评估。我们公开发布该标注数据集以供开放获取。
引用
@article{arxiv.2201.09997,
title = {Razmecheno: Named Entity Recognition from Digital Archive of Diaries "Prozhito"},
author = {Timofey Atnashev and Veronika Ganeeva and Roman Kazakov and Daria Matyash and Michael Sonkin and Ekaterina Voloshina and Oleg Serikov and Ekaterina Artemova},
journal= {arXiv preprint arXiv:2201.09997},
year = {2022}
}
备注
Submitted to LREC 2022