基于归一化流的通用音频合成器控制
机器学习
2019-07-03 v1 人机交互
多媒体
声音
音频与语音处理
机器学习
摘要
声音合成器的普及重塑了音乐制作,甚至完全定义了新的音乐流派。然而,现代合成器中日益增加的复杂性和参数数量使其更难掌握。因此,开发能够轻松创建和探索合成器的方法是一项关键需求。在此,我们引入一种新颖的音频合成器控制形式化。我们将其形式化为寻找一个有序的潜在音频空间来表示合成器的能力,同时构造到其参数空间的可逆映射。通过使用该形式化,我们展示了可以在单一模型中同时解决自动参数推断、宏控制学习和基于音频的预设探索。为解决这一新形式化,我们依赖变分自编码器(VAE)和归一化流(NF)来组织和映射相应的听觉与参数空间。我们引入了解耦流,其允许在分离的潜在空间之间执行可逆映射,同时通过拆分目标为偏密度评估将某些潜在维度的组织导向匹配目标变化因子。我们针对大量基线模型评估了我们的方案,并展示了其在参数推断和音频重建方面的优越性。我们还表明该模型将音频变化的主要因子解耦为潜在维度,可直接用作宏参数。我们也表明我们的模型能够通过平滑映射到其参数来学习合成器的语义控制。最后,我们讨论了我们的模型在创意应用中的使用及其在 Ableton Live 中的实时实现。
引用
@article{arxiv.1907.00971,
title = {Universal audio synthesizer control with normalizing flows},
author = {Philippe Esling and Naotake Masuda and Adrien Bardet and Romeo Despres and Axel Chemla--Romeu-Santos},
journal= {arXiv preprint arXiv:1907.00971},
year = {2019}
}
备注
DaFX 2019