基于扩散概率模型与Top-k选择判别器的环境声音分类数据增强
声音
2023-04-05 v3 音频与语音处理
摘要
尽管近年来强大的深度学习技术持续进步,模型仍需大量训练数据以避免过拟合。近期已使用生成对抗网络(GAN)生成合成数据集以克服该问题。然而,尽管有所进展,基于GAN的方法通常难以训练或无法生成高质量数据样本。本文提出一种基于扩散概率模型与DPM-Solver以实现快速采样的环境声音分类增强技术。此外,为保证生成谱图的质量,我们在该数据集上训练了一个top-k选择判别器。实验结果表明,合成谱图具有与原始数据集相似的特征,且相较于传统数据增强技术,能显著提升不同SOTA模型的分类准确率。公开代码见https://github.com/JNAIC/DPMs-for-Audio-Data-Augmentation。
引用
@article{arxiv.2303.15161,
title = {Data Augmentation for Environmental Sound Classification Using Diffusion Probabilistic Model with Top-k Selection Discriminator},
author = {Yunhao Chen and Yunjie Zhu and Zihui Yan and Jianlu Shen and Zhen Ren and Yifan Huang},
journal= {arXiv preprint arXiv:2303.15161},
year = {2023}
}