中文

基于图像到图像去噪扩散隐式模型的音色转换

音频与语音处理 2023-07-31 v2

摘要

音色转换技术旨在将一件乐器生成的乐曲声音转换为另一乐器演奏时的声音,同时尽可能保持旋律与力度等音乐特征方面的内容。继其在基于深度学习的生成中取得近期突破后,我们应用去噪扩散模型(Denoising Diffusion Models, DDMs)来执行音色转换。具体地,我们应用近期提出的去噪扩散隐式模型(Denoising Diffusion Implicit Models, DDIMs),其能够加速采样过程。受DDMs近期在图像翻译问题中应用的启发,我们以类似方式表述音色转换任务:首先将音轨转换为对数梅尔谱图(log mel spectrograms),并通过输入音色谱图来调节目标音色谱图的生成。我们分别进行了仅含单乐器和多乐器音频波形的单对单与多对多音色转换。我们通过听测与客观指标将所提技术与现有最先进(state-of-the-art, SOTA)方法进行比较,以证明所提模型的有效性。

关键词

引用

@article{arxiv.2307.04586,
  title  = {Timbre transfer using image-to-image denoising diffusion implicit models},
  author = {Luca Comanducci and Fabio Antonacci and Augusto Sarti},
  journal= {arXiv preprint arXiv:2307.04586},
  year   = {2023}
}