中文

基于音频频谱图 Transformer 与 Patch-Mix 对比学习的呼吸音分类

音频与语音处理 2024-12-30 v5 机器学习 声音

摘要

呼吸音包含对致命性肺部疾病早期诊断至关重要的信息。自 COVID-19 大流行以来,基于电子听诊器的无接触医疗护理兴趣日益增长。为此,已开发前沿深度学习模型以诊断肺部疾病;然而,由于医疗数据稀缺,这仍具挑战性。在本研究中,我们证明在大规模视觉与音频数据集上预训练的模型可泛化至呼吸音分类任务。此外,我们引入一种简洁的 Patch-Mix 增强方法,其在不同样本间随机混合块,结合 Audio Spectrogram Transformer (AST)。我们进一步提出一种新颖且有效的 Patch-Mix 对比学习,以在潜空间中区分混合表示。我们的方法在 ICBHI 数据集上取得最先进性能,以 4.08% 的提升超越先前领先分数。

关键词

引用

@article{arxiv.2305.14032,
  title  = {Patch-Mix Contrastive Learning with Audio Spectrogram Transformer on Respiratory Sound Classification},
  author = {Sangmin Bae and June-Woo Kim and Won-Yang Cho and Hyerim Baek and Soyoun Son and Byungjo Lee and Changwan Ha and Kyongpil Tae and Sungnyun Kim and Se-Young Yun},
  journal= {arXiv preprint arXiv:2305.14032},
  year   = {2024}
}

备注

INTERSPEECH 2023, Code URL: https://github.com/raymin0223/patch-mix_contrastive_learning