StyleWaveGAN:基于风格的鼓声合成与生成对抗网络广域控制
声音
2022-08-29 v1 音频与语音处理
摘要
本文介绍 StyleWaveGAN,一种基于风格的鼓声生成器,它是当前最先进图像生成器 StyleGAN 的一个变体。通过对 StyleWaveGAN 以鼓的类型及若干音频描述符为条件,我们能够在 GPU 上以快于实时的速度直接合成最长达 1.5 秒的 CD 质量波形,同时保持对生成过程相当程度的可控性。我们还提出了一种替代 GAN 渐进增长的方法,并实验了数据集平衡对生成任务的影响。实验在一个公开可用、包含不同鼓与镲片的数据集的增广子集上进行。我们与近期两种鼓声生成器 WaveGAN 和 NeuroDrum 进行对比评估,展示了显著改善的生成质量(以 Frechet 音频距离衡量)以及在感知特征上的有趣结果。
引用
@article{arxiv.2204.00907,
title = {StyleWaveGAN: Style-based synthesis of drum sounds with extensive controls using generative adversarial networks},
author = {Antoine Lavault and Axel Roebel and Matthieu Voiry},
journal= {arXiv preprint arXiv:2204.00907},
year = {2022}
}
备注
Accepted for publication in Sound and Music Computing 2022