中文

可解释多模态深度学习用于从呼吸音信号中自动检测肺部疾病

声音 2025-12-02 v1 人工智能 机器学习

摘要

呼吸道疾病仍是全球健康面临的主要挑战,传统的听诊诊断常受主观性、环境噪声以及临床医生间变异性的限制。本研究提出了一种用于自动肺部疾病检测的可解释多模态深度学习框架,基于呼吸音信号。该系统集成了两种互补的表征方法:一种基于 CNN-BiLSTM 注意力架构的时谱编码器,另一种捕获生理学有意义描述符(如 MFCC、谱心、谱带宽和零交叉率)的手工声学特征编码器。这两个分支通过后期融合相结合,以利用数据驱动的学习和领域知识的声学线索。该模型在经严格预处理(包括重采样、归一化、降噪、数据增强和患者水平分层划分)后,使用 Asthma Detection Dataset Version 2进行训练和评估。该研究实现了强大的泛化能力,准确率达91.21%,宏平均F1分数达0.899,宏ROC-AUC达0.9866,优于所有被剔除的变体。消融研究确认了时序建模、注意力机制和多模态融合的重要性。该框架集成了 Grad-CAM、Integrated Gradients 和 SHAP,生成与已知声学生物标志物一致的可解释时谱和特征层解释,以构建临床透明度。这些发现表明,该框架在远程医疗、点-of-care 诊断和实际 respiratory 筛查中具有潜在应用价值。

关键词

引用

@article{arxiv.2512.00563,
  title  = {Explainable Multi-Modal Deep Learning for Automatic Detection of Lung Diseases from Respiratory Audio Signals},
  author = {S M Asiful Islam Saky and Md Rashidul Islam and Md Saiful Arefin and Shahaba Alam},
  journal= {arXiv preprint arXiv:2512.00563},
  year   = {2025}
}