来自 GPU 赋能模块化合成的上十亿音频声音
声音
2021-07-21 v2 人工智能
机器学习
音频与语音处理
信号处理
摘要
我们发布 synth1B1,一个由 10 亿个 4 秒合成声音组成的多模态音频语料库,并配对用于生成它们的合成参数。该数据集比文献中任何音频数据集大 100 倍。我们还引入 torchsynth,一个开源模块化合成器,在单个 GPU 上以比实时快 16200 倍(714MHz)的速度即时生成 synth1B1 样本。最后,我们发布两个新音频数据集:FM 合成音色与减法合成音高。使用这些数据集,我们展示了针对现有音频表示的新的基于排序的评估准则。最后,我们提出一种合成器超参数优化的新方法。
引用
@article{arxiv.2104.12922,
title = {One Billion Audio Sounds from GPU-enabled Modular Synthesis},
author = {Joseph Turian and Jordie Shier and George Tzanetakis and Kirk McNally and Max Henry},
journal= {arXiv preprint arXiv:2104.12922},
year = {2021}
}