InverSynth:从音频信号深度估计合成器参数配置
声音
2019-11-22 v2 音频与语音处理
机器学习
摘要
声音合成是一个复杂领域,需要领域专业知识。即使对经验丰富的声音工程师而言,手动调节合成器参数以匹配特定声音也可能是一项耗费精力的工作。本文中,我们介绍 InverSynth——一种用于调节合成器参数以匹配给定输入声音的自动方法。InverSynth 基于步幅卷积神经网络,能够从输入频谱图甚至原始音频中推断出合成器参数配置。InverSynth 在一个具有四个频率调制振荡器、包络生成器和门控效果的减法合成器上展示了有效性。我们给出了大量定量与定性结果,展示了 InverSynth 相对于若干基线的优越性。此外,我们表明网络深度是对预测精度有重要贡献的因素。
引用
@article{arxiv.1812.06349,
title = {InverSynth: Deep Estimation of Synthesizer Parameter Configurations from Audio Signals},
author = {Oren Barkan and David Tsiris and Ori Katz and Noam Koenigstein},
journal= {arXiv preprint arXiv:1812.06349},
year = {2019}
}
备注
To appear in IEEE/ACM Transactions on Audio Speech and Language Processing