中文

基于咳嗽音频的无偏呼吸疾病诊断 AI 模型:以 COVID-19 为例

声音 2024-01-09 v1 机器学习 音频与语音处理

摘要

利用人工智能(AI)基于咳嗽进行呼吸系统疾病诊断引起了广泛关注,但许多现有研究忽视了其预测模型中的混杂变量。这些变量会扭曲咳嗽录音(输入数据)与呼吸系统疾病状态(输出变量)之间的关系,导致有偏的关联和不切实际的模型性能。为了填补这一空白,我们提出了无偏网络(RBFNet),这是一种有效减轻训练数据分布中混杂因素影响的端到端解决方案。RBFNet 确保了准确且无偏的呼吸系统疾病诊断特征,并通过在本研究中纳入 COVID-19 数据集来强调其相关性。该方法旨在通过应对混杂变量带来的挑战,提高基于 AI 的呼吸系统疾病诊断模型的可靠性。本文提出了一种卷积神经网络(CNN)与长短期记忆网络(LSTM)的混合架构,用于 RBFNet 的特征编码器模块。分类方案中加入了一个额外的偏差预测器,以构建条件生成对抗网络(cGAN),这有助于将混杂变量的影响与呼吸系统疾病预测解耦。通过在利用大规模专有咳嗽数据集创建的不同不平衡 COVID-19 数据集上进行训练,将分类性能与现有技术(SoTA)深度学习(DL)模型(CNN LSTM)进行比较,证明了 RBFNet 的优越性。RBF-Net 在极度有偏的训练场景中证明了其稳健性,在性别、年龄和吸烟状态这三个混杂变量下,其测试集准确率分别达到了 84.1%、84.6% 和 80.5%。RBF-Net 的测试集准确率分别比 CNN-LSTM 模型高出 5.5%、7.7% 和 8.2%。

关键词

引用

@article{arxiv.2401.02996,
  title  = {An AI-enabled Bias-Free Respiratory Disease Diagnosis Model using Cough Audio: A Case Study for COVID-19},
  author = {Tabish Saeed and Aneeqa Ijaz and Ismail Sadiq and Haneya N. Qureshi and Ali Rizwan and Ali Imran},
  journal= {arXiv preprint arXiv:2401.02996},
  year   = {2024}
}

备注

13 pages, 7 figures, 5 tables