中文

利用机器学习与人工智能从人群全血细胞计数预测 SARS-CoV-2 感染

应用统计 2021-04-13 v2 定量方法

摘要

自 2019 年 12 月以来,新型冠状病毒 SARS-CoV-2 已被确认为大流行 COVID-19 的病原。早期症状与普通感冒和流感等其他常见病症重叠,使得早期筛查与诊断成为临床工作者的关键目标。本研究旨在利用机器学习(ML)、人工神经网络(ANN)及简单统计检验,在不知晓个体症状或病史的情况下,从全血细胞计数识别 SARS-CoV-2 阳性患者。纳入分析与训练的数据集包含来自巴西圣保罗 Hospital Israelita Albert Einstein 就诊患者匿名化的全血细胞计数结果,这些患者在就诊期间采集了样本以进行 SARS-CoV-2 rt-PCR 检测。患者数据由医院匿名化,临床数据标准化为均值零、单位标准差。该数据公开旨在使研究人员能够开发方法,帮助医院快速预测并潜在识别 SARS-CoV-2 阳性患者。我们发现,基于全血细胞计数,随机森林、浅层学习及灵活的 ANN 模型在普通病房人群(AUC = 94-95%)与未入院或社区人群(AUC=80-86%)间以高准确度预测 SARS-CoV-2 患者。此处 AUC 为受试者工作特征曲线下面积,是模型性能的度量。此外,4 项血细胞的简单线性组合可用于社区内患者达到 85% 的 AUC。SARS-CoV-2 阳性患者的不同血液参数归一化数据表现出血小板、白细胞、嗜酸性粒细胞、嗜碱性粒细胞和淋巴细胞减少,以及单核细胞增多。

关键词

引用

@article{arxiv.2007.06971,
  title  = {Use of Machine Learning and Artificial Intelligence to predict SARS-CoV-2 infection from Full Blood Counts in a population},
  author = {Abhirup Banerjee and Surajit Ray and Bart Vorselaars and Joanne Kitson and Michail Mamalakis and Simonne Weeks and Mark Baker and Louise S. Mackenzie},
  journal= {arXiv preprint arXiv:2007.06971},
  year   = {2021}
}