中文

调谐入耳:有限数据临床环境下音频分类器性能分析

声音 2024-04-09 v3 人工智能 机器学习 音频与语音处理

摘要

本研究评估了深度学习模型在临床环境下的音频分类性能,其约束条件是反映现实世界前瞻性数据收集的小数据集。我们分析了包括 DenseNet 和 ConvNeXt 在内的 CNN,以及 ViT、SWIN 和 AST 等 transformer 模型,并将它们与 YAMNet 和 VGGish 等预训练音频模型进行了比较。我们的方法强调了在特定临床数据上进行微调之前先在大型数据集上进行预训练的优势。我们前瞻性收集了两个首创的卒中患者音频数据集。我们调查了各种预处理技术,发现 RGB 和灰度谱图变换根据模型从预训练中学到的先验知识,对模型性能产生不同的影响。我们的发现表明,在小数据集背景下,CNN 可以匹敌或超越 transformer 模型,其中 DenseNet-Contrastive 和 AST 模型表现出显著的性能。本研究强调了通过模型选择、预训练和预处理在声音分类中实现增量边际增益的重要性;这为依赖音频分类的临床诊断提供了宝贵的见解。

关键词

引用

@article{arxiv.2402.10100,
  title  = {Tuning In: Analysis of Audio Classifier Performance in Clinical Settings with Limited Data},
  author = {Hamza Mahdi and Eptehal Nashnoush and Rami Saab and Arjun Balachandar and Rishit Dagli and Lucas X. Perri and Houman Khosravani},
  journal= {arXiv preprint arXiv:2402.10100},
  year   = {2024}
}

备注

CHIL 2024