用于更优细粒度命名实体识别的级联模型
计算与语言
2020-09-17 v1
摘要
命名实体识别 (NER) 是许多自然语言应用(如关系抽取或事件抽取)的重要前置任务。许多 NER 研究是在具有少量实体类型(例如 PER、LOC、ORG、MISC)的数据集上进行的,但许多现实世界应用(灾难救援、复杂事件抽取、执法)可受益于更大的 NER 类型集。最近,创建了具有数百到数千种实体类型的数据集,引发了新的研究方向 (Sekine, 2008; Ling and Weld, 2012; Gillick et al., 2014; Choi et al., 2018)。在本文中,我们提出一种用于细粒度 NER 标注的级联方法,应用于 TAC KBP 2019 评测中使用的 newly released 细粒度 NER 数据集 (Ji et al., 2019),其灵感在于部分粗粒度标签的训练数据是可用的。使用 transformer 网络的组合,我们表明与基于完整细粒度类型构建的直接模型相比,性能可提高约 20 个绝对 F1,并表明令人惊讶的是,使用三种语言的粗标注数据可带来英文数据的改进。
引用
@article{arxiv.2009.07317,
title = {Cascaded Models for Better Fine-Grained Named Entity Recognition},
author = {Parul Awasthy and Taesun Moon and Jian Ni and Radu Florian},
journal= {arXiv preprint arXiv:2009.07317},
year = {2020}
}