中文

利用机器学习模型高效分析 COVID-19 临床数据

机器学习 2021-10-20 v1

摘要

由于 COVID-19 迅速蔓延至全球几乎每个角落,海量数据和病例研究得以公开,为研究人员提供了前所未有的机会,通过利用此类大数据来发现趋势并取得突破。这些数据种类繁多,且可信度层次不一(如精确、不精确、不确定和缺失),使得从中提取重要信息颇具挑战。然而,对持续生成和演化的 COVID-19 数据进行高效分析,对于实时指导控制、缓解并最终避免病毒传播的相关措施至关重要。将基于机器学习的算法应用于该大数据是实现此目标的天然途径,因为它们可快速扩展到此类数据,并在数据多样且可信度不一的情况下提取相关信息。这对 COVID-19 以及未来潜在的大流行病普遍重要。在本文中,我们设计了一种将临床数据(关于分类属性)直接编码为定长特征向量表示的简单方法,并提出一种模型,首先从该表示中执行高效特征选择。我们在两个 COVID-19 患者临床数据集上应用此方法,随后下游应用不同的机器学习算法进行分类。我们表明,借助高效特征选择算法,大多数情况下预测准确率可达 90% 以上。我们还利用信息增益计算了数据集中不同属性重要性。这有助于政策制定者仅关注某些属性来研究该疾病,而非关注可能对患者结局信息量不大的多个随机因素。

关键词

引用

@article{arxiv.2110.09606,
  title  = {Efficient Analysis of COVID-19 Clinical Data using Machine Learning Models},
  author = {Sarwan Ali and Yijing Zhou and Murray Patterson},
  journal= {arXiv preprint arXiv:2110.09606},
  year   = {2021}
}