中文

带有噪声零样本教师的多标签音频分类

音频与语音处理 2024-07-23 v1

摘要

我们提出了一种新颖的训练方案,采用自标签纠正和数据增强方法,以应对噪声标签并提高多标签音频内容检测任务在真实世界中的准确率。该数据增强方法通过混合多个音频剪辑并合并其标签来减少标签噪声,同时与多标签兼容。我们此外还展示了通过自标签纠正方法(使用相同的预训练模型)可以提高性能。最后,我们证明了使用像CLAP这样的强大零样本模型为无标签数据生成标签是可行的,并且可以使用所提出的训练和标签增强方法来提高结果。最终得到的模型在性能上与CLAP相似,却是一个高效且适用于移动设备的架构,并且可以快速适应未标记的声音类别。

关键词

引用

@article{arxiv.2407.14712,
  title  = {Multi-label audio classification with a noisy zero-shot teacher},
  author = {Sebastian Braun and Hannes Gamper},
  journal= {arXiv preprint arXiv:2407.14712},
  year   = {2024}
}

备注

accepted at IEEE IWAENC 2024