中文

解耦双编码器掩码自编码器用于呼吸音分类

音频与语音处理 2025-06-16 v2 声音

摘要

深度神经网络已应用于音频时谱图进行呼吸音分类,但由于数据稀缺,仍然难以实现令人满意的性能。此外,呼吸音样本来自各种电子听诊器、患者人口统计特征以及录音环境,这可能导致训练模型时出现域间不匹配。为解决此问题,我们提出了一种修改版 MaskedAutoencoder(MAE) 模型,称为解耦双编码器掩码自编码器 (DDE-MAE),用于呼吸音分类。设计了两个独立的编码器分别捕获与疾病相关和与疾病无关的信息,实现特征解耦以减少域间不匹配。我们的方法在 ICBHI 数据集上取得了竞争的性能。

关键词

引用

@article{arxiv.2506.10698,
  title  = {Disentangling Dual-Encoder Masked Autoencoder for Respiratory Sound Classification},
  author = {Peidong Wei and Shiyu Miao and Lin Li},
  journal= {arXiv preprint arXiv:2506.10698},
  year   = {2025}
}

备注

(Accepted at Interspeech 2025)