中文

基于参考集增强自助法的生物医学命名实体识别

机器学习 2019-06-04 v1 计算与语言 机器学习

摘要

我们提出一种弱监督数据增强方法,以改进具有挑战性领域中的命名实体识别(NER):从科学文献中抽取生物医学实体(如蛋白质)。首先,我们在一小组完全标注的 seed 样本上训练一个神经 NER(NNER)模型。其次,我们使用实体名称的参考集(如 UniProt 中的蛋白质)在未标注语料上以高精度但低召回识别实体提及。第三,我们使用 NNER 模型为语料分配弱标签。最后,我们在增强训练集(包括 seed、参考集样本与弱标签样本)上迭代地重新训练我们的 NNER 模型,从而提升模型性能。我们通过实证表明该增强自助过程显著改进了 NER 性能,并讨论了影响该方法有效性的因素。

关键词

引用

@article{arxiv.1906.00282,
  title  = {Biomedical Named Entity Recognition via Reference-Set Augmented Bootstrapping},
  author = {Joel Mathew and Shobeir Fakhraei and José Luis Ambite},
  journal= {arXiv preprint arXiv:1906.00282},
  year   = {2019}
}

备注

5 pages, 1 Figure, 2 Table, ICML 2019 Workshop on Computational Biology