中文

有限知识下生物医学命名实体的标注与规范化

计算与语言 2019-12-20 v1

摘要

命名实体识别(NER)是任何新领域语言处理的第一步。目前在英语临床文本的 BioNLP 中是一个常见过程。然而,在其他主要语言中仍处于起步阶段,西班牙语便是如此。本文在 PharmaCoNER 共享任务的框架下,描述了一种非常简单的用于临床病例中药理、化学以及最终生物医学命名实体的标注与规范化的方法。为共享任务开发的系统基于有限知识,这些知识以明显优于过去类似基于词典的英语系统得分的方式被收集、结构化并整理。随着这种基于知识的方法在子领域 NER 中的复兴,本文也突出了基于资源的系统在对标注指南和人工标注实践进行验证与巩固方面的关键贡献。在这个意义上,一些作者关于人工标注数据集整体质量的发现,对上述系统取得的“官方”结果提出了质疑,该系统在两个 PharmaCoNER 子任务中分别排名第二(0.91 F1 分数)和第一(0.916 F1 分数)。

关键词

引用

@article{arxiv.1912.09152,
  title  = {Annotating and normalizing biomedical NEs with limited knowledge},
  author = {Fernando Sánchez León and Ana González Ledesma},
  journal= {arXiv preprint arXiv:1912.09152},
  year   = {2019}
}

备注

8 pages; unpublished contribution to the PharmaCoNER shared task held as part of BioNLP-OST 2019