利用 Spark NLP 改进 COVID-19 研究的临床文档理解
计算与语言
2020-12-09 v1 信息检索
摘要
在全球 COVID-19 大流行之后,研究该病毒的科学论文数量大幅增长,导致对自动化文献综述的兴趣增加。我们提出了一个临床文本挖掘系统,在三个方面改进了此前的努力。首先,除其他常用临床与生物医学实体外,它能识别超过 100 种不同的实体类型,包括健康的社会决定因素、解剖结构、风险因素和不良事件。其次,文本处理流水线包含断言状态检测,以区分存在的、不存在的、条件性的或关于患者以外他人的临床事实。第三,所使用的深度学习模型比此前可用的更准确,利用了最先进的预训练命名实体识别模型的集成流水线,并改进了先前性能最佳的断言状态检测基准。我们展示了从 COVID-19 开放研究数据集(CORD-19)中提取趋势与洞察,例如最常见的障碍与症状,以及最常见的生命体征与心电图发现。该系统使用 Spark NLP 库构建,其原生支持扩展到分布式集群、利用 GPU、可配置且可复用的 NLP 流水线、医疗特定嵌入,以及无需更改代码即可训练模型以支持新实体类型或人类语言的能力。
引用
@article{arxiv.2012.04005,
title = {Improving Clinical Document Understanding on COVID-19 Research with Spark NLP},
author = {Veysel Kocaman and David Talby},
journal= {arXiv preprint arXiv:2012.04005},
year = {2020}
}
备注
Accepted to SDU (Scientific Document Understanding) workshop at AAAI 2021