中文

修订版 JNLPBA 语料库:面向关系抽取任务的生物医学命名实体识别语料库修订版

信息检索 2020-08-20 v1 计算与语言

摘要

生物医学命名实体识别(BNER)与生物医学关系抽取(BRE)研究的发展推动了生物领域文本挖掘的进步。作为 BRE 的基石,稳健的 BNER 系统需要识别纯文本中被提及的命名实体(NE),以供后续关系抽取阶段使用。然而,在这些任务中发挥重要作用的现有 BNER 语料库较少关注满足 BRE 任务的准则。在本研究中,我们提出修订版 JNLPBA 语料库,即 JNLPBA 语料库的修订版,以拓宽 NER 语料库从 BNER 到 BRE 任务的适用性。我们保留了原始的实体类型,包括蛋白质、DNA、RNA、细胞系和细胞类型,同时 JNLPBA 语料库中的所有摘要由领域专家依据新的标注指南(聚焦于特定 NE 而非通用术语)再次人工校订。同时,我们指出 JNLPBA 中若干不完善问题并在新语料库中予以弥补。为比较不同 NER 系统在修订版 JNLPBA 与 JNLPBA 语料库中的适应性,我们在 BANNER、Gimli 和 NERSuite 三个开源 NER 系统中测量了 F1 值。在相同条件下,所有系统在修订版 JNLPBA 上的表现平均比在 JNLPBA 上高 10%。此外,我们进行了交叉验证测试,在 JNLPBA/修订版 JNLPBA 语料库上训练 NER 系统,并在蛋白质-蛋白质相互作用抽取(PPIE)与生物医学事件抽取(BEE)语料库上评估性能,以确认新精炼的修订版 JNLPBA 是生物医学关系应用中胜任的 NER 语料库。修订版 JNLPBA 语料库可免费获取于 iasl-btm.iis.sinica.edu.tw/BNER/Content/Revised_JNLPBA.zip。

关键词

引用

@article{arxiv.1901.10219,
  title  = {Revised JNLPBA Corpus: A Revised Version of Biomedical NER Corpus for Relation Extraction Task},
  author = {Ming-Siang Huang and Po-Ting Lai and Richard Tzong-Han Tsai and Wen-Lian Hsu},
  journal= {arXiv preprint arXiv:1901.10219},
  year   = {2020}
}

备注

17 pages