中文

大规模生物医学命名实体识别

计算与语言 2020-11-13 v1 人工智能 机器学习

摘要

命名实体识别(NER)是一项广泛适用的自然语言处理任务,也是问答、主题建模、信息检索等的构建模块。在医学领域,NER通过从临床笔记与报告中提取有意义的片段发挥着关键作用,这些片段随后被送入断言状态检测、实体解析、关系抽取与去标识等下游任务。我们在Apache Spark之上重新实现了Bi-LSTM-CNN-Char深度学习架构,提出了一个单一可训练的NER模型,该模型在七个公开生物医学基准上取得了新的SOTA结果,且未使用如BERT等重型上下文嵌入。这包括将BC4CHEMD提升至93.72%(提升4.1%)、Species800提升至80.91%(提升4.6%)、JNLPBA提升至81.29%(提升5.2%)。此外,该模型作为开源Spark NLP库的一部分,在 production-grade 代码库中免费提供;可在任意Spark集群中扩展用于训练与推理;具有GPU支持以及面向Python、R、Scala和Java等流行编程语言的库;并且无需更改代码即可扩展以支持其他人类语言。

关键词

引用

@article{arxiv.2011.06315,
  title  = {Biomedical Named Entity Recognition at Scale},
  author = {Veysel Kocaman and David Talby},
  journal= {arXiv preprint arXiv:2011.06315},
  year   = {2020}
}

备注

Accepted for presentation and inclusion in CADL 2020 (International Workshop on Computational Aspects of Deep Learning) , organized in conjunction with ICPR 2020, the 25th International Conference on Pattern Recognition