中文

用于自动化儿科肺部音分类的多阶段混合 CNN-Transformer 网络

信号处理 2025-10-21 v2 人工智能

摘要

肺部音听诊的自动化分析对于监测呼吸系统健康至关重要,尤其是在面临熟练医疗人员短缺的地区。尽管呼吸音分类在成人中已被广泛研究,但其在儿科人群中的应用,特别是 6 岁以下儿童中,仍是一个未充分探索的领域。儿科肺部的发育变化显著改变了呼吸音的声学特性,因此需要针对该年龄段量身定制的专门分类方法。为解决这一问题,我们提出了一种多阶段混合 CNN-Transformer 框架,该框架将 CNN 提取的特征与基于注意力的架构相结合,使用来自完整录音和单次呼吸事件的时频图图像对儿科呼吸系统疾病进行分类。通过采用逐类焦点损失来解决数据不平衡问题,我们的模型在二元事件分类中取得了 0.9039 的总分,在多类事件分类中取得了 0.8448 的总分。在录音级别,该模型在三分类和多分类任务中分别获得了 0.720 和 0.571 的分数。这些分数分别比先前的最佳模型高出 3.81% 和 5.94%。该方法为可扩展的儿科呼吸系统疾病诊断提供了一种有前景的解决方案,尤其是在资源有限的环境中。

关键词

引用

@article{arxiv.2507.20408,
  title  = {A Multi-Stage Hybrid CNN-Transformer Network for Automated Pediatric Lung Sound Classification},
  author = {Samiul Based Shuvo and Taufiq Hasan},
  journal= {arXiv preprint arXiv:2507.20408},
  year   = {2025}
}