通过合成器编程实现创意文本到音频生成
声音
2024-06-04 v1 机器学习
音频与语音处理
摘要
神经音频合成方法现在允许用自然语言指定想法。然而,这些方法产生的结果不易调整,因为它们基于巨大的潜在空间和多达数十亿个不可解释的参数。我们提出了一种文本到音频生成方法,该方法利用一个仅有78个参数的虚拟模块化声音合成器。合成器因其灵活性和直观的控制,长期以来一直被熟练的声音设计师用于音乐和电影等媒体。我们的方法CTAG迭代地更新合成器的参数,以生成文本提示的高质量音频渲染,这些渲染可以轻松检查和调整。以这种方式产生的声音也更加抽象,捕捉核心概念特征而非精细的声学细节,类似于简单的草图如何生动地传达视觉概念。我们的结果表明,CTAG产生的声音具有独特性,被视为艺术性,并且与最近的神经音频合成模型同样易于识别,使其成为一种有价值的补充工具。
引用
@article{arxiv.2406.00294,
title = {Creative Text-to-Audio Generation via Synthesizer Programming},
author = {Manuel Cherep and Nikhil Singh and Jessica Shand},
journal= {arXiv preprint arXiv:2406.00294},
year = {2024}
}
备注
Accepted to ICML 2024