基于机器学习与全球智能手机录音的 COVID-19 咳嗽分类
摘要
我们提出了一种基于机器学习的 COVID-19 咳嗽分类器,能够区分智能手机录制的 COVID-19 阳性咳嗽与 COVID-19 阴性及健康咳嗽。此类筛查为非接触式、易实施,并可减少检测中心的工作负担,同时通过向咳嗽提示为 COVID-19 者建议早期自我隔离来限制传播。本研究使用的数据集涵盖全部六大洲受试者,包含强迫性咳嗽与自然咳嗽,表明该方法具有广泛适用性。公开可用的 Coswara 数据集包含 92 名 COVID-19 阳性和 1079 名健康受试者,而第二个较小的数据集主要在南非收集,包含 18 名经 SARS-CoV 实验室检测的 COVID-19 阳性和 26 名 COVID-19 阴性受试者。两个数据集均表明 COVID-19 阳性咳嗽比非 COVID 咳嗽短 15%–20%。通过应用合成少数类过采样技术(SMOTE)解决数据集偏斜问题。采用留-p-外交叉验证方案训练并评估七种机器学习分类器:LR、KNN、SVM、MLP、CNN、LSTM 和 Resnet50。我们的结果表明,尽管所有分类器均能识别 COVID-19 咳嗽,Resnet50 分类器表现最佳,其最能区分 COVID-19 阳性与健康咳嗽,ROC 曲线下面积(AUC)为 0.98。LSTM 分类器最能区分 COVID-19 阳性与 COVID-19 阴性咳嗽,在顺序前向选择(SFS)选出最佳 13 个特征后 AUC 为 0.94。由于此类咳嗽音频分类成本低且易部署,其潜在为一种有用且可行的非接触式 COVID-19 筛查手段。
引用
@article{arxiv.2012.01926,
title = {COVID-19 Cough Classification using Machine Learning and Global Smartphone Recordings},
author = {Madhurananda Pahar and Marisa Klopper and Robin Warren and Thomas Niesler},
journal= {arXiv preprint arXiv:2012.01926},
year = {2022}
}
备注
This paper has been accepted in "Computers in Medicine and Biology" and currently under production