中文

对比深度学习模型用于直接呼吸衰竭检测与血氧饱和度估计

声音 2024-08-06 v1 机器学习 音频与语音处理

摘要

我们对比了针对呼吸衰竭(RI)检测和血氧饱和度(SpO2_2)估计与分类通过自动化音频分析所设计的专用于通用音频分类任务的前沿深度学习架构的高效性。最近,多个深度学习架构被提出用于通过音频分析检测新冠患者中的RI,准确率超过95%,F1分数超过0.93。RI是一种与低SpO2_2水平相关的疾病,通常定义为SpO2_2 <92%。虽然SpO2_2是RI的关键决定因子,医生的诊断通常依赖于多个因素,包括呼吸频率、心率、SpO2_2水平等。本文研究了预训练的音频神经网络(CNN6、CNN10和CNN14)以及掩码自编码器(Audio-MAE)用于RI检测,这些模型实现了接近完美的准确率,超越了以前的结果。然而,对于估计SpO2_2水平的回归任务,模型的均方根误差值超过了指尖氧合仪接受的临床范围3.5%。此外,皮尔逊相关系数未能超过0.3。由于深度学习模型在分类方面表现优于回归,我们将SpO2_2回归转化为以92%为阈值的SpO2_2阈值二分类问题。但该任务仍 yield F1分数低于0.65。因此,音频分析为患者RI状态提供了有价值的见解,但未能提供关于实际SpO2_2水平的准确信息,表明在当前技术下,语音和语言生物标志物在医学诊断中可能有用或不可能有的领域存在分离。

关键词

引用

@article{arxiv.2407.20989,
  title  = {Contrasting Deep Learning Models for Direct Respiratory Insufficiency Detection Versus Blood Oxygen Saturation Estimation},
  author = {Marcelo Matheus Gauy and Natalia Hitomi Koza and Ricardo Mikio Morita and Gabriel Rocha Stanzione and Arnaldo Candido Junior and Larissa Cristina Berti and Anna Sara Shafferman Levin and Ester Cerdeira Sabino and Flaviane Romani Fernandes Svartman and Marcelo Finger},
  journal= {arXiv preprint arXiv:2407.20989},
  year   = {2024}
}

备注

23 pages, 4 figures, in review at Journal of Biomedical Signal Processing and Control