基于 DDSP 的实时音色迁移与声音合成
声音
2021-03-15 v1 机器学习
音频与语音处理
摘要
神经音频合成是一个活跃的研究课题,已产生多种利用机器学习架构的技术。Google Magenta 提出了一种称为微分数字信号处理(DDSP)的新方法,将深度神经网络与预处理数字信号处理技术相结合,在音色迁移应用中达到了最先进的结果。然而,包括 DDSP 在内的大多数技术通常无法在实时约束下应用,使其不适用于音乐工作流。在本文中,我们提出了 DDSP 库的实时实现,其作为插件嵌入虚拟合成器中,可在数字音频工作站中使用。我们专注于从真实乐器的学习表征到任意声音输入的音色迁移,以及通过 MIDI 控制这些模型。此外,我们开发了一个用于直观高层控制的 GUI,可用于后处理并操控神经网络估计的参数。我们在线对七名参与者进行了用户体验测试。结果表明,用户认为该界面有吸引力、易于理解且值得进一步探索。同时,我们发现了音色迁移质量、某些未实现的组件以及插件安装与分发方面的问题。我们设计的下一次迭代将解决这些问题。我们的实时 MATLAB 和 JUCE 实现分别可在 https://github.com/SMC704/juce-ddsp 和 https://github.com/SMC704/matlab-ddsp 获取。
引用
@article{arxiv.2103.07220,
title = {Real-time Timbre Transfer and Sound Synthesis using DDSP},
author = {Francesco Ganis and Erik Frej Knudesn and Søren V. K. Lyster and Robin Otterbein and David Südholt and Cumhur Erkut},
journal= {arXiv preprint arXiv:2103.07220},
year = {2021}
}