声合成器的神经代理:学习感知信息化的预设表示
声音
2025-09-10 v1 机器学习
音频与语音处理
摘要
深度学习似乎是解决自动声合成器编程(ASP)的吸引力解决方案,这旨在帮助音乐家和声设计师编程声合成器。然而,将软件声合成器集成到训练管道中具有挑战性,由于其潜在不可微。本工作通过引入一种方法来近似任意声合成器来解决此挑战。具体而言,我们训练一个神经网络将声合成器的预设映射到源自预训练模型的音频嵌入空间。这 facilitates定义产生紧凑且有效表示的神经代理,从而 enable将音频嵌入损失集成到基于神经的ASP系统中,用于黑箱声合成器。我们评估了 various 预训练音频模型在神经基于nASP 上情境下所得表示的效果,并评估了几种神经网络架构,包括前馈、循环和基于变换器的模型, 在定义神经代理方面的效果。我们使用合成和 hand-crafted 预设,来自三款流行软件声合成器,对所提出的方法进行评估,并在声合成器 sound matching 下游任务中评估其性能。尽管学习到的表示的好处受资源要求的影响,但对所有声合成器都获得了鼓舞人心的结果,为将声合成器代理用于神经基于ASP系统的未来研究之路铺平了道路。
引用
@article{arxiv.2509.07635,
title = {Neural Proxies for Sound Synthesizers: Learning Perceptually Informed Preset Representations},
author = {Paolo Combes and Stefan Weinzierl and Klaus Obermayer},
journal= {arXiv preprint arXiv:2509.07635},
year = {2025}
}
备注
17 pages, 4 figures, published in the Journal of the Audio Engineering Society