中文

通过合成器建模动物发声

声音 2022-10-21 v1 音频与语音处理

摘要

对真实世界声音建模是机器学习创造性应用以及包括人类语音处理与生物声学在内的许多其他领域的基本问题。基于 Transformer 的生成模型及一些先前工作(如 DDSP)已知可产生逼真声音,尽管它们可控性有限且难以解释。作为替代,我们旨在使用模块化合成器,即可组合的、参数化的电子乐器,来建模非音乐声音。然而,给定目标声音推断合成器参数,即参数推断任务,对一般声音而言并非易事,且过去的研究通常聚焦于音乐声音。本工作中,我们优化来自 TorchSynth 的可微分合成器,以建模、仿真并创造性生成动物发声。我们比较了一系列优化方法,从基于梯度的搜索到遗传算法,用于推断其参数,并随后展示如何控制与解释用于建模非音乐声音的参数。

关键词

引用

@article{arxiv.2210.10857,
  title  = {Modeling Animal Vocalizations through Synthesizers},
  author = {Masato Hagiwara and Maddie Cusimano and Jen-Yu Liu},
  journal= {arXiv preprint arXiv:2210.10857},
  year   = {2022}
}