EnvGAN:用于数据增强的环境声音对抗式合成
音频与语音处理
2021-04-16 v1 声音
摘要
随着深度学习算法的出现,环境声音分类(ESC)的研究正在逐步增长。然而,数据稀缺对该领域的任何重大进展都构成了主要障碍。数据增强为此问题提供了极好的解决方案。虽然生成对抗网络(GAN)已成功生成合成语音和乐器声音,但它们几乎未被应用于环境声音的生成。本文提出 EnvGAN,即 GAN 在环境声音对抗式生成中的首次应用。我们在三个标准 ESC 数据集上的实验表明,EnvGAN 能够合成与数据集中相似的声音。所提出的增强方法优于大多数前瞻性的音频增强技术。
引用
@article{arxiv.2104.07326,
title = {EnvGAN: Adversarial Synthesis of Environmental Sounds for Data Augmentation},
author = {Aswathy Madhu and Suresh K},
journal= {arXiv preprint arXiv:2104.07326},
year = {2021}
}
备注
Submitted to IEEE Transactions on Audio, Speech and Language Processing