面向呼吸声分析和多模态诊断的变换器架构
声音
2026-01-21 v1
摘要
呼吸声分析是筛查哮喘和其他肺部疾病的关键工具,但传统的听诊仍然主观且依赖经验。我们的 prior research 建立了使用 DenseNet201 的 CNN baseline,显示出在分类呼吸声方面具有高灵敏度。在本工作中,我们 (i) 将 Audio Spectrogram Transformer (AST) 用于呼吸声分析, (ii) 评估一种集成声谱图和结构化患者元数据的多模态 Vision-Language Model (VLM)。AST 使用公开可用的权重初始化,并在包含数百个 recordings per诊断的数据集上进行微调。VLM 实验使用一种紧凑的 Moondream 类型模型,用于处理声谱图图像以及结构化文本提示 (性别、年龄、录音部位),输出 JSON 格式的诊断结果。结果表明,AST 在哮喘检测中准确率约为97%,F1 分数约为97%,ROC AUC 为0.98,显著优于内部 CNN baseline 和典型外部基准。VLM 达到86-87%的准确率,性能相当于 CNN baseline,同时显示出将临床背景整合到推理过程中的能力。这些结果确认了自注意力在声学筛查中的有效性,并凸显了多模态架构用于全面诊断工具的潜力。
引用
@article{arxiv.2601.14227,
title = {Transformer Architectures for Respiratory Sound Analysis and Multimodal Diagnosis},
author = {Theodore Aptekarev and Vladimir Sokolovsky and Gregory Furman},
journal= {arXiv preprint arXiv:2601.14227},
year = {2026}
}
备注
7 pages, 4 figures