DrumGAN:利用生成对抗网络通过音色特征条件化合成鼓声
音频与语音处理
2022-06-29 v2 声音
摘要
鼓声的合成(例如鼓机中)通常通过模拟或数字合成来完成,使音乐人能够通过修改各种参数来塑造所需的音色。通常,此类参数控制声音的底层特征,且往往不具备音乐含义或感知对应关系。随着深度学习的兴起,数据驱动的音频处理作为传统信号处理的替代方案而出现。这一新范式允许通过学习到的高层特征或在具有音乐相关信息条件化的模型下控制合成过程。在本文中,我们将生成对抗网络应用于鼓声音频合成任务。通过以使用公开可用特征提取器计算得到的感知特征作为模型条件,我们获得了对生成过程的直观控制。实验在一个大规模的底鼓、军鼓和镲片声音集合上进行。我们表明,相较于基于 U-Net 架构的特定先前工作,我们的方法显著提升了生成鼓样本的质量,并且条件输入确实塑造了声音的感知特性。此外,我们提供了音频示例并发布了实验中所用的代码。
引用
@article{arxiv.2008.12073,
title = {DrumGAN: Synthesis of Drum Sounds With Timbral Feature Conditioning Using Generative Adversarial Networks},
author = {J. Nistal and S. Lattner and G. Richard},
journal= {arXiv preprint arXiv:2008.12073},
year = {2022}
}
备注
8 pages, 1 figure, 3 tables, accepted in Proc. of the 21st International Society for Music Information Retrieval (ISMIR2020)