基于众包呼吸语音数据开发 COVID-19 多变量预测模型
声音
2026-05-13 v2 人工智能
音频与语音处理
摘要
COVID-19 已影响全球 223 多个国家,在后 COVID 时代,迫切需要非侵入性、低成本且高度可扩展的解决方案来检测 COVID-19。我们开发了一种深度学习模型,用于从语音录音数据中识别 COVID-19。本工作的新颖之处在于开发了仅基于语音录音进行 COVID-19 识别的深度学习模型。我们使用了剑桥 COVID-19 声音数据库,其中包含通过 COVID-19 Sounds 应用程序从 4352 名参与者众包收集的 893 个语音样本。提取了包括 Mel 频谱图、Mel 频率倒谱系数(MFCC)和 CNN 编码器特征在内的语音特征。基于语音数据,我们开发了深度学习分类模型以检测 COVID-19 病例。这些模型包括长短期记忆网络(LSTM)、卷积神经网络(CNN)和 Hidden-Unit BERT(HuBERT)。我们将它们的预测能力与基线机器学习模型进行了比较。HuBERT 实现了 86\% 的最高准确率和 0.93 的最高 AUC。所提出模型取得的结果表明,与最先进方法获得的结果相比,从语音录音中诊断 COVID-19 具有广阔的前景。
引用
@article{arxiv.2402.07619,
title = {Developing a Multi-variate Prediction Model For COVID-19 From Crowd-sourced Respiratory Voice Data},
author = {Yuyang Yan and Wafaa Aljbawi and Sami O. Simons and Visara Urovi},
journal= {arXiv preprint arXiv:2402.07619},
year = {2026}
}
备注
arXiv admin note: text overlap with arXiv:2209.03727