通过查询短语表示自动构建命名实体识别数据集
计算与语言
2023-06-02 v4
摘要
大多数弱监督命名实体识别(NER)模型依赖于专家提供的领域特定词典。这种方法在许多不存在词典的领域中不可行。尽管近期一项研究使用短语检索模型从维基百科自动检索实体以构建伪词典,但这些词典通常覆盖有限,因为检索器倾向于检索热门实体而非稀有实体。在本研究中,我们提出一种新颖框架 HighGEN,利用高覆盖伪词典生成 NER 数据集。具体而言,我们通过一种称为短语嵌入搜索的新颖检索方法构建富含实体的词典,该方法鼓励检索器在密集分布各类实体的空间中搜索。此外,我们基于候选实体提及与实体类型之间的嵌入距离使用一种新的验证过程,以减少高覆盖词典生成的弱标签中的假阳性噪声。我们证明 HighGEN 在五个 NER 基准数据集上以平均 F1 分数 4.7 优于先前最佳模型。
引用
@article{arxiv.2210.07586,
title = {Automatic Creation of Named Entity Recognition Datasets by Querying Phrase Representations},
author = {Hyunjae Kim and Jaehyo Yoo and Seunghyun Yoon and Jaewoo Kang},
journal= {arXiv preprint arXiv:2210.07586},
year = {2023}
}
备注
ACL 2023