中文

改进生物医学文本中的多词实体识别

计算与语言 2019-08-19 v1

摘要

生物医学命名实体识别(BioNER)是分析生物医学文本的关键步骤,旨在从给定文本中抽取生物医学命名实体。不同研究人员已将多种有监督机器学习算法应用于 BioNER。这些方法的主要要求是使用标注数据集来学习机器学习算法的参数。片段表示(SR)模型包含用于表示标注数据的不同标签集,如 IOB2、IOE2 和 IOBES。本文中,我们提出 IOBES 模型的扩展以改进 BioNER 的性能。所提出的 SR 模型 FROBES 改进了多词实体的表示。我们使用双向长短期记忆(BiLSTM)网络(循环神经网络(RNN)的一种实例)设计了 BioNER 的基线系统,并在两个数据集 i2b2/VA 2010 challenge dataset 和 JNLPBA 2004 shared task dataset 上评估了新的 SR 模型。所提出的 SR 模型在长度大于二的多词实体上优于其他模型。此外,使用多数投票集成方法组合了不同 SR 模型的输出,其性能优于基线模型。

关键词

引用

@article{arxiv.1908.05691,
  title  = {Improving Multi-Word Entity Recognition for Biomedical Texts},
  author = {Hamada A. Nayel and H. L. Shashirekha and Hiroyuki Shindo and Yuji Matsumoto},
  journal= {arXiv preprint arXiv:1908.05691},
  year   = {2019}
}

备注

13 pages, 2 figures, International Conference on Cognitive Informatics and Soft Computing (ICCISC-2017)