中文

面向临床音频数据集的条件生成数据增强

声音 2025-02-11 v3 机器学习 音频与语音处理

摘要

在本工作中,我们提出了一种面向临床音频数据集的新型数据增强方法,该方法基于在 log-mel 频谱图上运行的条件 Wasserstein 生成对抗网络与梯度惩罚 (cWGAN-GP)。为了验证我们的方法,我们创建了一个临床音频数据集,该数据集是在全髋关节置换术 (THA) 过程中于真实手术室录制的,包含类似于手术不同阶段的典型声音。我们证明了所提出方法从数据集分布中生成逼真的类别条件样本的能力,并表明使用生成的增强样本进行训练,在分类性能方面优于经典的音频增强方法。使用 ResNet-18 分类器对性能进行了评估,结果表明在使用所提出的增强方法的 5 折交叉验证实验中,平均 Macro F1-score 提高了 1.70%。由于临床数据通常获取成本高昂,开发逼真且高质量的数据增强方法对于提高基于学习算法的鲁棒性和泛化能力至关重要,这对于安全攸关的医疗应用尤为重要。因此,所提出的数据增强方法是改善临床音频机器学习系统数据瓶颈的重要一步。

关键词

引用

@article{arxiv.2203.11570,
  title  = {Conditional Generative Data Augmentation for Clinical Audio Datasets},
  author = {Matthias Seibold and Armando Hoch and Mazda Farshad and Nassir Navab and Philipp Fürnstahl},
  journal= {arXiv preprint arXiv:2203.11570},
  year   = {2025}
}