DDSP:可微分数字信号处理
机器学习
2020-01-15 v1 声音
音频与语音处理
信号处理
机器学习
摘要
大多数音频生成模型直接在时域或频域之一中生成样本。尽管这些表示足以表达任何信号,但它们效率低下,因为未利用关于声音如何生成与感知的已有知识。第三种方法(声码器/合成器)成功融入了信号处理与感知的强领域知识,但由于表达能力有限且难以与现代基于自动微分的机器学习方法集成,相关研究较少。本文介绍可微分数字信号处理(DDSP)库,其实现了经典信号处理元件与深度学习方法的直接集成。聚焦于音频合成,我们在无需大型自回归模型或对抗损失的情况下实现了高保真生成,表明 DDSP 能在不损失神经网络表达能力的前提下利用强归纳偏置。此外,我们展示可解释模块的组合允许对每个独立模型组件进行操控,应用包括音高与响度的独立控制、对训练时未见音高的真实外推、房间声学的盲去混响、将提取的房间声学迁移至新环境,以及不同源之间音色的转换。简言之,DDSP 实现了一种可解释且模块化的生成建模方法,且不牺牲深度学习的优势。该库公开于 https://github.com/magenta/ddsp,我们欢迎社区与领域专家的进一步贡献。
引用
@article{arxiv.2001.04643,
title = {DDSP: Differentiable Digital Signal Processing},
author = {Jesse Engel and Lamtharn Hantrakul and Chenjie Gu and Adam Roberts},
journal= {arXiv preprint arXiv:2001.04643},
year = {2020}
}