AudioFuse:通过混合 ViT-1D CNN 架构实现统一谱-时间学习以实现鲁棒心音图分类
音频与语音处理
2025-09-30 v1 人工智能
机器学习
声音
信号处理
摘要
生物医学音频信号,如心音图(PCG),本质上是节奏性的,并在其谱(音调)域和时间域中均包含诊断信息。标准 2D 频谱图提供了丰富的谱特征,但牺牲了 1D 波形的相位信息和时间精度。我们提出了 AudioFuse,一种同时从两种互补表示中学习的架构,用于对 PCG 进行分类。为缓解融合模型中常见的过拟合风险,我们将一个定制的宽而浅的视觉 Transformer(ViT)用于频谱图与一个浅层 1D CNN 用于原始波形相结合。在 PhysioNet 2016 数据集上,AudioFuse 从头训练时取得了具有竞争力的最先进 ROC-AUC 0.8608,超越了其频谱图基线(0.8066)和波形基线(0.8223)。此外,它在具有挑战性的 PASCAL 数据集上展现出对域偏移的优越鲁棒性,保持 ROC-AUC 为 0.7181,而频谱图基线崩溃至 0.4873。因此,融合互补表示提供了强归纳偏置,使得无需大规模预训练即可创建高效、通用的分类器。
引用
@article{arxiv.2509.23454,
title = {AudioFuse: Unified Spectral-Temporal Learning via a Hybrid ViT-1D CNN Architecture for Robust Phonocardiogram Classification},
author = {Md. Saiful Bari Siddiqui and Utsab Saha},
journal= {arXiv preprint arXiv:2509.23454},
year = {2025}
}
备注
Submitted to ICASSP 2026. This preprint includes some additional details beyond the conference submission