增强文档级命名实体识别的标签一致性
计算与语言
2022-10-25 v1 人工智能
机器学习
摘要
命名实体识别(NER)是从生物医学应用文档中提取信息的基础环节。NER 的一个显著优势是在文档语境下提取生物医学实体时具有一致性。尽管现有文档级 NER 模型表现出一致的预测,但仍未达预期。我们探究了实体内形容词与介词是否导致标签一致性低,从而造成预测不一致。本文提出方法 ConNER,其增强了修饰语(如形容词与介词)的标签依赖性,以实现更高的标签一致性。ConNER 细化修饰语的草拟标签,从而改进生物医学实体的输出表示。我们在四个流行的生物医学 NER 数据集上证明了方法的有效性;尤其在两个数据集上 F1 分数取得 7.5-8.6% 的绝对提升,证实了其效用。我们解读 ConNER 方法对内在标签一致性低的数据集有效。在定性分析中,我们展示了该方法如何使 NER 模型生成一致的预测。我们的代码与资源见于 https://github.com/dmis-lab/ConNER/。
引用
@article{arxiv.2210.12949,
title = {Enhancing Label Consistency on Document-level Named Entity Recognition},
author = {Minbyul Jeong and Jaewoo Kang},
journal= {arXiv preprint arXiv:2210.12949},
year = {2022}
}