中文

用于谐波声音混合中合成参数提取的可微数字信号处理混合模型

声音 2022-02-02 v1 机器学习 音频与语音处理

摘要

可微数字信号处理 (DDSP) 自编码器是一种结合深度神经网络 (DNN) 与谱建模合成的音乐声音合成器。它允许我们通过改变从输入声音提取的基频、音色特征和响度(合成参数)来灵活编辑声音。然而,它是为单音谐波声音设计的,无法处理谐波声音的混合。在本文中,我们提出一种模型(DDSP 混合模型),将混合表示为多个预训练 DDSP 自编码器输出的和。通过将所提模型的输出拟合到观测混合,我们可以直接估计每个声源的合成参数。通过合成参数提取实验,我们表明与将 DDSP 自编码器应用于由音频源分离方法分离出的信号的直接方法相比,所提方法具有更高且更稳定的性能。

关键词

引用

@article{arxiv.2202.00200,
  title  = {Differentiable Digital Signal Processing Mixture Model for Synthesis Parameter Extraction from Mixture of Harmonic Sounds},
  author = {Masaya Kawamura and Tomohiko Nakamura and Daichi Kitamura and Hiroshi Saruwatari and Yu Takahashi and Kazunobu Kondo},
  journal= {arXiv preprint arXiv:2202.00200},
  year   = {2022}
}

备注

5 pages, 2 figures, to appear in 2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP 2022)