基于期望实体比例损失的局部监督命名实体识别
计算与语言
2021-08-17 v1
摘要
我们研究在实体标注缺失情况下的命名实体识别器学习。我们将此设定视为带潜变量的标注,并提出一种新颖的损失函数——期望实体比例(Expected Entity Ratio),以在系统性缺失标签的情况下学习模型。我们表明我们的方法在理论上严谨且经验上有效。实验上,我们发现其在多种语言、标注场景与标注数据量下达到或超越强基线及最先进(SOTA)基线的性能。特别地,我们发现,在仅含 1,000 条有偏标注的具有挑战性设定下(跨 7 个数据集平均),其显著超越 Mayhew 等人(2019)与 Li 等人(2021)的先前 SOTA 方法,F1 分数分别高出 +12.7 与 +2.3。我们还表明,当与我们的方法结合时,一种新颖的稀疏标注方案在中等标注预算下优于穷尽标注。
引用
@article{arxiv.2108.07216,
title = {Partially Supervised Named Entity Recognition via the Expected Entity Ratio Loss},
author = {Thomas Effland and Michael Collins},
journal= {arXiv preprint arXiv:2108.07216},
year = {2021}
}
备注
Accepted in TACL 2021, pre-MIT Press publication version