中文

SoundCollage: 音频数据集中新类别的自动发现

声音 2025-01-22 v2 音频与语音处理

摘要

开发新的机器学习应用通常需要收集新的数据集。然而,现有的数据集可能已经包含用于训练新用途模型的相关信息。我们提出 SoundCollage:一个通过在音频样本中(1)引入音频预处理流水线来分解不同声音,以及(2)采用基于模型的自动标注机制来识别所发现类别的框架。此外,我们引入清晰度度量来评估所发现类别的连贯性,以便更好地训练新的下游应用。我们的评估表明,在所发现类别样本和保留数据集上,下游音频分类器的准确率分别比基线提高了最多 34.7% 和 4.5%。这些结果凸显了 SoundCollage 在通过新发现类别进行标注使数据集可复用方面的潜力。为鼓励该领域的进一步研究,我们在 https://github.com/nokia-bell-labs/audio-class-discovery 开源代码。

关键词

引用

@article{arxiv.2410.23008,
  title  = {SoundCollage: Automated Discovery of New Classes in Audio Datasets},
  author = {Ryuhaerang Choi and Soumyajit Chatterjee and Dimitris Spathis and Sung-Ju Lee and Fahim Kawsar and Mohammad Malekzadeh},
  journal= {arXiv preprint arXiv:2410.23008},
  year   = {2025}
}

备注

5 pages, 2 figures. Accepted in IEEE ICASSP 2025