中文

在高负担环境中使用咳嗽分析和语音基础模型进行结核病筛查的深度学习

声音 2025-10-02 v2 音频与语音处理

摘要

人工智能 (AI) 系统可以检测咳嗽声中与疾病相关的声学模式,为高负担、资源有限环境下的结核病 (TB) 筛查提供了一种可扩展且具有成本效益的方法。以往的研究受到小数据集、有症状非 TB 患者代表性不足以及在受控环境中收集录音的限制。在本研究中,我们在赞比亚的两家医院招募了 512 名参与者,分为三组:细菌学确诊的 TB (TB+)、患有其他呼吸道疾病的有症状患者 (OR) 和健康对照 (HC)。从 500 名参与者中获得了可用的咳嗽录音以及人口统计学和临床数据。基于预训练语音基础模型的深度学习分类器在咳嗽录音上进行微调,以预测诊断类别。表现最佳的模型在 3 秒音频片段上训练,在区分 TB 咳嗽与所有其他参与者 (TB+/Rest) 时达到 85.2% 的 AUROC,在 TB+ 与有症状 OR 参与者 (TB+/OR) 的区分中达到 80.1%。结合人口统计学和临床特征后,TB+/Rest 的性能提升至 92.1%,TB+/OR 提升至 84.2%。在概率阈值为 0.38 时,多模态模型对 TB+/Rest 达到 90.3% 的敏感性和 73.1% 的特异性,满足了 WHO 的 TB 筛查目标产品特性基准。对抗性测试和分层分析表明,该模型对包括背景噪声、录音时间和设备变异性在内的混杂因素具有鲁棒性。这些结果证明了在真实世界、低资源环境下基于咳嗽的 AI 用于 TB 筛查的可行性。

关键词

引用

@article{arxiv.2509.09746,
  title  = {Deep Learning for Tuberculosis Screening in a High-burden Setting using Cough Analysis and Speech Foundation Models},
  author = {Ning Ma and Bahman Mirheidari and Guy J. Brown and Nsala Sanjase and Minyoi M. Maimbolwa and Solomon Chifwamba and Seke Muzazu and Monde Muyoyeta and Mary Kagujje},
  journal= {arXiv preprint arXiv:2509.09746},
  year   = {2025}
}

备注

submitted to IEEE Journal of Biomedical and Health Informatics