中文

用于零样本环境声音分类的嵌入空间扩散

声音 2025-07-03 v2 机器学习 音频与语音处理

摘要

零样本学习通过利用语义信息使模型能够泛化到未见过的类别,从而弥合训练集和测试集之间类别不重叠的差距。虽然大量研究集中在计算机视觉中的零样本学习,但这些方法在环境音频中的应用仍未得到充分探索,现有研究表现不佳。在计算机视觉中已证明成功的生成方法,在零样本环境声音分类研究中明显缺失。为填补这一空白,本工作研究了环境音频中零样本学习的生成方法。我们改编了两种来自计算机视觉的成功生成模型:交叉对齐和分布对齐变分自编码器 (CADA-VAE) 以及利用不变侧生成对抗网络 (LisGAN)。此外,我们引入了一种以类别辅助数据为条件的新型扩散模型。扩散模型生成的合成嵌入与已见类别的嵌入相结合,用于训练分类器。我们在五个环境音频数据集(ESC-50、ARCA23K-FSD、FSC22、UrbanSound8k 和 TAU Urban Acoustics 2019)和一个音乐分类数据集 GTZAN 上进行了实验。结果表明,扩散模型在六个音频数据集上的平均性能优于所有基线方法。本工作确立了扩散模型作为零样本学习的一种有前景的方法,并首次为零样本环境声音分类建立了生成方法的基准,为未来研究奠定了基础。

关键词

引用

@article{arxiv.2412.03771,
  title  = {Embedding-Space Diffusion for Zero-Shot Environmental Sound Classification},
  author = {Ysobel Sims and Alexandre Mendes and Stephan Chalup},
  journal= {arXiv preprint arXiv:2412.03771},
  year   = {2025}
}

备注

This work has been submitted to the IEEE for possible publication