中文

CRASH:基于分数的可控高分辨率鼓声原始音频生成模型

声音 2021-06-15 v1 机器学习 音频与语音处理

摘要

在本文中,我们提出了一种用于无条件原始音频合成的新型基于分数的生成模型。我们的方案建立在最新发展的基于随机微分方程的扩散过程建模之上,该建模已在图像生成中展现出有前景的结果。我们提出了更适合音频生成的扩散过程选择的新启发式方法,并考虑使用条件 U-Net 来近似分数函数。虽然先前音频扩散模型的方法主要被设计为中等分辨率的语音声码器,我们称之为 CRASH(基于分数的可控原始音频合成)的方法允许我们以可控方式生成 44.1kHz 的短促打击乐声音。通过大量实验,我们在鼓声生成任务上展示了我们方法提供的多种采样方案(无条件生成、确定性生成、修复、插值、变体、类条件采样),并提出了类混合采样——一种生成“混合”声音的新方法。我们提出的方法在原始音频上缩小了与基于 GAN 的方法的差距,同时以更轻量且更易训练的模型提供了更灵活的生成能力。

关键词

引用

@article{arxiv.2106.07431,
  title  = {CRASH: Raw Audio Score-based Generative Modeling for Controllable High-resolution Drum Sound Synthesis},
  author = {Simon Rouard and Gaëtan Hadjeres},
  journal= {arXiv preprint arXiv:2106.07431},
  year   = {2021}
}

备注

12 pages, 11 figures