中文

基于扩散概率模型与Top-k选择判别器的环境声音分类数据增强

声音 2023-04-05 v3 音频与语音处理

摘要

尽管近年来强大的深度学习技术持续进步,模型仍需大量训练数据以避免过拟合。近期已使用生成对抗网络(GAN)生成合成数据集以克服该问题。然而,尽管有所进展,基于GAN的方法通常难以训练或无法生成高质量数据样本。本文提出一种基于扩散概率模型与DPM-Solver++++以实现快速采样的环境声音分类增强技术。此外,为保证生成谱图的质量,我们在该数据集上训练了一个top-k选择判别器。实验结果表明,合成谱图具有与原始数据集相似的特征,且相较于传统数据增强技术,能显著提升不同SOTA模型的分类准确率。公开代码见https://github.com/JNAIC/DPMs-for-Audio-Data-Augmentation。

关键词

引用

@article{arxiv.2303.15161,
  title  = {Data Augmentation for Environmental Sound Classification Using Diffusion Probabilistic Model with Top-k Selection Discriminator},
  author = {Yunhao Chen and Yunjie Zhu and Zihui Yan and Jianlu Shen and Zhen Ren and Yifan Huang},
  journal= {arXiv preprint arXiv:2303.15161},
  year   = {2023}
}