中文

InverSynth:从音频信号深度估计合成器参数配置

声音 2019-11-22 v2 音频与语音处理 机器学习

摘要

声音合成是一个复杂领域,需要领域专业知识。即使对经验丰富的声音工程师而言,手动调节合成器参数以匹配特定声音也可能是一项耗费精力的工作。本文中,我们介绍 InverSynth——一种用于调节合成器参数以匹配给定输入声音的自动方法。InverSynth 基于步幅卷积神经网络,能够从输入频谱图甚至原始音频中推断出合成器参数配置。InverSynth 在一个具有四个频率调制振荡器、包络生成器和门控效果的减法合成器上展示了有效性。我们给出了大量定量与定性结果,展示了 InverSynth 相对于若干基线的优越性。此外,我们表明网络深度是对预测精度有重要贡献的因素。

关键词

引用

@article{arxiv.1812.06349,
  title  = {InverSynth: Deep Estimation of Synthesizer Parameter Configurations from Audio Signals},
  author = {Oren Barkan and David Tsiris and Ori Katz and Noam Koenigstein},
  journal= {arXiv preprint arXiv:1812.06349},
  year   = {2019}
}

备注

To appear in IEEE/ACM Transactions on Audio Speech and Language Processing