中文

面向生物医学实体识别的部分标注学习

计算与语言 2023-05-23 v1 机器学习

摘要

动机:命名实体识别(NER)是支撑生物医学研究的关键任务。在生物医学命名实体识别(BioNER)中,获取高质量的专家标注数据费力且昂贵,催生了远程监督等自动化方法。然而,人工与自动生成的数据常受未标注实体问题困扰,即大量实体标注缺失,削弱了全标注 NER 模型的性能。结果:为应对该问题,我们系统研究了部分标注学习方法在不同缺失实体标注模拟场景下对生物医学实体识别的有效性。此外,我们提出了 TS-PubMedBERT-Partial-CRF 部分标注学习模型。我们整合涵盖五类实体的 15 个生物医学 NER 语料作为金标准,并与两种常用部分标注学习模型 BiLSTM-Partial-CRF、EER-PubMedBERT 以及最先进的全标注学习 BioNER 模型 PubMedBERT tagger 进行比较。结果表明,基于部分标注学习的方法能有效从含缺失实体标注的生物医学语料中学习。我们提出的模型优于其他模型,尤其在高中缺失实体率下 F1 值较 PubMedBERT tagger 高出 38%。我们模型的实体提及召回率也与全标注数据集上的上界相当。

关键词

引用

@article{arxiv.2305.13120,
  title  = {Partial Annotation Learning for Biomedical Entity Recognition},
  author = {Liangping Ding and Giovanni Colavizza and Zhixiong Zhang},
  journal= {arXiv preprint arXiv:2305.13120},
  year   = {2023}
}

备注

9 pages, 4 figures, 2 tables