从临床文本中抽取 COVID-19 诊断与症状:一个新的标注语料库与神经事件抽取框架
计算与语言
2021-03-12 v2 机器学习
摘要
2019 冠状病毒病(COVID-19)是一场全球大流行。尽管自新冠病毒出现以来已对其有了诸多了解,但在追踪其传播、描述症状学、预测感染严重程度以及预测医疗资源利用方面仍存在许多开放性问题。自由文本临床记录包含解决这些问题的关键信息。在大规模研究中利用这一文本编码信息,需要数据驱动的自动信息抽取模型。本工作提出了一个新的临床语料库,称为 COVID-19 标注临床文本(CACT)语料库,包含 1,472 份带有详细标注的病历,刻画了 COVID-19 诊断、检测与临床表现。我们引入了一个基于跨度的事件抽取模型,联合抽取所有标注现象,在识别 COVID-19 与症状事件及其相关断言值方面取得了高性能(事件 F1 为 0.83-0.97,断言 F1 为 0.73-0.79)。在一个二次应用案例中,我们探索了利用结构化患者数据(如生命体征和实验室结果)与自动抽取的症状信息来预测 COVID-19 检测结果。自动抽取的症状改善了预测性能,超越了仅使用结构化数据的表现。
引用
@article{arxiv.2012.00974,
title = {Extracting COVID-19 Diagnoses and Symptoms From Clinical Text: A New Annotated Corpus and Neural Event Extraction Framework},
author = {Kevin Lybarger and Mari Ostendorf and Matthew Thompson and Meliha Yetisgen},
journal= {arXiv preprint arXiv:2012.00974},
year = {2021}
}