中文

利用深度迁移学习与瓶颈特征从咳嗽、呼吸和语音中检测COVID-19

声音 2022-05-12 v4 机器学习 音频与语音处理

摘要

我们提出一项实验研究,考察迁移学习与瓶颈特征提取在从咳嗽、呼吸和语音的音频记录中检测COVID-19的有效性。此类筛查为非接触式,不需要专业医学知识或实验室设施,并可部署于廉价的消费级硬件上。我们使用包含咳嗽、打喷嚏、语音和其他噪声但不含COVID-19标签的数据集,来预训练三个深度神经网络:一个CNN、一个LSTM和一个Resnet50。这些预训练网络随后或在迁移学习过程中使用带有COVID-19标签的较小咳嗽数据集进行微调,或用作瓶颈特征提取器。结果表明,经此迁移学习过程训练的Resnet50分类器在所有数据集上均取得最优或接近最优的性能,对全部三类声音(咳嗽、呼吸和语音)的受试者工作特征曲线下面积(ROC AUC)分别达到0.98、0.94和0.92。这表明咳嗽携带最强的COVID-19信号,其次为呼吸和语音。我们的结果还显示,使用不含COVID-19标签的较大数据集进行迁移学习和瓶颈特征提取,不仅提升了性能,还最小化了留-pp-外交叉验证的外折中分类器AUC的标准差,表明更好的泛化能力。我们得出结论:深度迁移学习与瓶颈特征提取可改善COVID-19咳嗽、呼吸和语音音频分类,产生更高精度的自动分类器。

关键词

引用

@article{arxiv.2104.02477,
  title  = {COVID-19 Detection in Cough, Breath and Speech using Deep Transfer Learning and Bottleneck Features},
  author = {Madhurananda Pahar and Marisa Klopper and Robin Warren and Thomas Niesler},
  journal= {arXiv preprint arXiv:2104.02477},
  year   = {2022}
}