DDX7:乐器声音的可微分 FM 合成
声音
2022-08-15 v1 机器学习
音频与语音处理
信号处理
摘要
FM 合成是一种众所周知的算法,用于从紧凑的设计基元集合生成复杂音色。它通常配备 MIDI 接口,一般难以从音频源进行控制。另一方面,可微分数字信号处理(DDSP)已使深度神经网络(DNNs)能够通过学习从任意声音输入控制可微分合成层来实现细致的音频渲染。训练过程涉及用于监督的音频语料库与谱重建损失函数。此类函数在匹配谱幅度方面虽表现良好,却缺乏音高导向,可能妨碍 FM 合成器参数的联合优化。本文中,我们朝着从音频输入连续控制成熟的 FM 合成架构迈进。首先,我们讨论一组通过标准重建损失缓解可微分 FM 合成器谱优化的设计约束。接着,我们提出可微分 DX7(DDX7),一种以紧凑参数集实现乐器声音神经 FM 重合成的轻量架构。我们在从 URMP 数据集提取的乐器样本上训练模型,并定量展示其相对于选定基准的可比音频质量。
引用
@article{arxiv.2208.06169,
title = {DDX7: Differentiable FM Synthesis of Musical Instrument Sounds},
author = {Franco Caspe and Andrew McPherson and Mark Sandler},
journal= {arXiv preprint arXiv:2208.06169},
year = {2022}
}
备注
Accepted to ISMIR 2022. See online supplement at https://fcaspe.github.io/ddx7/