中文

EasyNER:用于医学与生命科学文本中基于深度学习与词典的命名实体识别的可定制易用流水线

定量方法 2025-10-17 v3 计算与语言

摘要

背景 医学与生命科学研究产生了数百万篇出版物,研究人员难以充分利用这些信息,因为其规模和复杂性远超人类阅读能力。自动化文本挖掘可帮助提取并连接散布于大量文献中的信息,但生命科学研究人员不易获取该技术。方法与结果 在此,我们开发了一个易用的端到端流水线,用于基于深度学习和词典的医学与生命科学研研究文章典型实体(包括疾病、细胞、化学品、基因/蛋白质、物种等)的命名实体识别(NER)。该流水线可访问并处理大型医学研究文章集(PubMed、CORD-19)或原始文本,并整合了一系列在 HUNER 语料库集合上微调的深度学习模型。此外,该流水线可执行与 COVID-19 及其他医学主题相关的基于词典的 NER。用户也可加载自己的 NER 模型和词典以包含额外实体。输出包括发表就绪的检测到实体的排序列表与图表,以及包含注释文本的文件。此外,我们提供了两个辅助脚本,允许处理 PubTator 格式的文件并快速检查特定关注实体的结果。作为模型用例,该流水线部署于来自 PubMed 的自噬相关摘要集合以及 CORD19 数据集(一个包含 764 398 篇 COVID-19 相关研究文章摘要的集合)。结论 我们提出的 NER 流水线适用于多种医学研究环境,并使生命科学研究人员可使用可定制的文本挖掘。

关键词

引用

@article{arxiv.2304.07805,
  title  = {EasyNER: A Customizable Easy-to-Use Pipeline for Deep Learning- and Dictionary-based Named Entity Recognition from Medical and Life Science Text},
  author = {Rafsan Ahmed and Petter Berntsson and Alexander Skafte and Salma Kazemi Rashed and Marcus Klang and Adam Barvesten and Ola Olde and William Lindholm and Antton Lamarca Arrizabalaga and Pierre Nugues and Sonja Aits},
  journal= {arXiv preprint arXiv:2304.07805},
  year   = {2025}
}